Sobre o projeto

PageIndex é um motor de geração aumentada por recuperação (RAG) de código aberto que substitui a busca por similaridade vetorial por um índice em árvore hierárquica e raciocínio de LLM. O projeto argumenta que similaridade não é o mesmo que relevância, e que a relevância em documentos profissionais longos requer raciocínio em vez de busca por embeddings. Como funciona: a recuperação ocorre em duas etapas. Primeiro, uma etapa de indexação gera um índice em estrutura de árvore para cada documento. Segundo, um agente de busca navega agenticamente nessa árvore usando raciocínio de LLM, semelhante a como um especialista humano navega por um relatório longo. O README afirma que a estrutura da árvore é extraída do layout do documento sem um LLM, com o modelo de indexação apenas resumindo e refinando, de modo que um modelo básico seria suficiente no momento da indexação. O modelo de chat, que busca na árvore, é onde o README recomenda usar o melhor modelo disponível. Instalação e uso: o SDK é instalado com pip install -U pageindex. Um PageIndexClient é configurado com um modelo de indexação e um modelo de chat, um documento é submetido para obter um doc_id, e perguntas são feitas via client.chat(). O README menciona um modo local que executa indexação, recuperação e chat na máquina do usuário com sua própria chave de LLM, e um modo em nuvem que aponta o mesmo cliente para o PageIndex Cloud usando uma chave de API. O modo em nuvem é descrito como lidando com parsing, OCR, compreensão de imagens, construção de índice em árvore e armazenamento gerenciado, com citações em nível de linha e um servidor MCP, enquanto o modo local é posicionado para PDFs com muito texto e fluxos de trabalho locais com citações em nível de página. O README também descreve integração com frameworks de agentes como o OpenAI Agents SDK e o Claude Agent SDK, além de uma camada de Sistema de Arquivos PageIndex para raciocinar sobre um corpus inteiro em vez de um único documento. Os benchmarks relatados no README incluem custo de indexação local de aproximadamente US$ 0,001 por página, tempos de indexação de cerca de 13 segundos a 4,5 minutos para documentos de 9 a 1.098 páginas, uma comparação que afirma que a entrada nativa em PDF custa 2,1x mais em 52 páginas e 16,6x mais em 420 páginas, e uma precisão relatada de 98,7% no FinanceBench. Essas cifras vêm da documentação do projeto e do repositório de benchmarks e não são verificadas independentemente aqui. Os casos de uso alvo mencionados no README incluem relatórios financeiros, documentos legais, registros regulatórios, manuais técnicos, literatura médica e livros didáticos acadêmicos.