Sobre el proyecto

PageIndex es un motor de generación aumentada por recuperación (RAG) de código abierto que reemplaza la búsqueda por similitud vectorial con un índice de árbol jerárquico y razonamiento de LLM. El proyecto sostiene que la similitud no es lo mismo que la relevancia, y que la relevancia en documentos profesionales largos requiere razonamiento en lugar de búsqueda por incrustaciones. Cómo funciona: la recuperación ocurre en dos pasos. Primero, un paso de indexación genera un índice en forma de árbol para cada documento. Segundo, un agente de recuperación busca de manera agnóstica ese árbol usando razonamiento de LLM, similar a cómo un experto humano navega por un informe largo. El README indica que la estructura del árbol se extrae del diseño del documento sin un LLM, con el modelo de indexación solo resumiéndola y refinándola, por lo que se dice que un modelo básico es suficiente en el momento de la indexación. El modelo de chat, que busca en el árbol, es donde el README recomienda usar el mejor modelo disponible. Instalación y uso: el SDK se instala con pip install -U pageindex. Un PageIndexClient se configura con un modelo de indexación y un modelo de chat, se envía un documento para obtener un doc_id, y se hacen preguntas mediante client.chat(). El README señala un modo local que ejecuta la indexación, recuperación y chat en la máquina del usuario con su propia clave de LLM, y un modo en la nube que apunta al mismo cliente a PageIndex Cloud usando una clave de API. El modo en la nube se describe como encargado del análisis, OCR, comprensión de imágenes, construcción del índice de árbol y almacenamiento gestionado, con citaciones a nivel de línea y un servidor MCP, mientras que el modo local se posiciona para PDFs con mucho texto y flujos de trabajo locales con citaciones a nivel de página. El README también describe la integración con frameworks de agentes como el OpenAI Agents SDK y el Claude Agent SDK, y una capa de Sistema de Archivos PageIndex para razonar sobre todo un corpus en lugar de un solo documento. Los benchmarks reportados en el README incluyen un costo de indexación local de aproximadamente $0.001 por página, tiempos de indexación de unos 13 segundos a 4.5 minutos para documentos de 9 a 1.098 páginas, una comparación que afirma que la entrada nativa de PDF cuesta 2.1x más en 52 páginas y 16.6x más en 420 páginas, y una precisión reportada del 98.7% en FinanceBench. Estas cifras provienen de la documentación y el repositorio de benchmarks del proyecto y no están verificadas independientemente aquí. Los casos de uso mencionados en el README incluyen informes financieros, documentos legales, presentaciones regulatorias, manuales técnicos, literatura médica y libros de texto académicos.