这个项目能做什么

PageIndex 是一款开源的检索增强生成(RAG)引擎,用分层树索引和 LLM 推理替代了传统的向量相似度搜索。项目认为相似度不等于相关性,对长专业文档的相关性检索需要推理而非嵌入查找。 工作原理:检索分两步进行。首先,索引步骤为每份文档生成树形结构索引;其次,检索步骤让智能体利用 LLM 推理搜索该树,类似人类专家翻阅长篇报告。README 指出,树形结构从文档布局中提取,无需 LLM,索引模型仅负责总结和细化,因此基础模型即可满足索引需求。而负责搜索树的对话模型,README 建议使用最强的可用模型。 安装与使用:通过 pip install -U pageindex 安装 SDK。PageIndexPathClient 配置索引模型和对话模型后,提交文档获取 doc_id,再通过 client.chat() 提问。README 提到本地模式可在用户机器上使用自己的 LLM 密钥运行索引、检索和聊天;云模式则将同一客户端指向 PageIndex Cloud 并使用 API 密钥。云模式处理解析、OCR、图像理解、树索引构建和托管存储,提供行级引用和 MCP 服务器;本地模式适用于文本密集型 PDF 和本地工作流,提供页面级引用。 README 还描述了与 OpenAI Agents SDK 和 Claude Agent SDK 等 Agent 框架的集成,以及用于对整个语料库进行推理的 PageIndex 文件系统层。 README 中报告的基准测试数据包括:本地索引成本约每页 0.001 美元,9 至 1,098 页的文档索引时间为 13 秒至 4.5 分钟,对比称原生 PDF 输入在 52 页时贵 2.1 倍、420 页时贵 16.6 倍,FinanceBench 上准确率达 98.7%。这些数据来自项目自身文档和基准测试仓库,此处未经独立验证。 README 明确的目标应用场景包括财务报告、法律文件、监管备案、技术手册、医学文献和学术教材。