프로젝트 소개
PageIndex는 벡터 유사성 검색을 계층적 트리 인덱스와 LLM 추론으로 대체하는 오픈소스 검색 강화 생성(RAG) 엔진입니다. 이 프로젝트는 유사성이 관련성과 다르며, 긴 전문 문서에서의 관련성은 임베딩 조회가 아닌 추론에 필요하다고 주장합니다.
작동 방식: 검색은 두 단계로 이루어집니다. 먼저 인덱싱 단계에서 각 문서의 트리 구조 인덱스를 생성합니다. 이후 검색 단계에서 LLM 추론을 사용해 해당 트리를 탐색하는데, 이는 전문가가 긴 보고서를 살펴보는 방식과 유사합니다. README에 따르면 트리 구조는 LLM 없이 문서 레이아웃에서 추출되며, 인덱싱 모델은 요약 및 정제만 수행하므로 기본 모델로도 충분합니다. 트리를 검색하는 채팅 모델에는 가장 우수한 모델을 사용하는 것이 권장됩니다.
설치 및 사용법: SDK는 pip install -U pageindex로 설치합니다. PageIndexClient를 인덱싱 모델과 채팅 모델로 구성한 후 문서를 제출해 doc_id를 받으면 client.chat()로 질문할 수 있습니다. README에서는 로컬 모드와 클라우드 모드를 소개합니다. 로컬 모드는 LLM 키를 사용해 인덱싱, 검색, 채팅을 사용자 기기에서 실행하고, 클라우드 모드는 API 키로 PageIndex Cloud를 사용합니다. 클라우드 모드는 문서 파싱, OCR, 이미지 이해, 트리 인덱스 구성 및 관리형 저장을 처리하며 줄 수준 인용과 MCP 서버를 제공합니다. 로컬 모드는 텍스트 중심 PDF와 페이지 수준 인용이 필요한 로컬 워크플로우에 적합합니다.
또한 OpenAI Agents SDK 및 Claude Agent SDK 등 에이전트 프레임워크와의 통합과, 단일 문서가 아닌 전체 코퍼스에 대해 추론할 수 있는 PageIndex 파일 시스템 레이어를 지원합니다.
README에 Reported된 벤치마크는 로컬 인덱싱 비용이 페이지당 약 $0.001, 인덱싱 시간이 9페이지에서 13초, 1,098페이지에서 4.5분 정도 소요된다고 합니다. 또한 네이티브 PDF 입력 대비 52페이지에서는 2.1배, 420페이지에서는 16.6배 비싼 비용이 든다고 비교했으며, FinanceBench에서 98.7% 정확도를 달성했다고 보고합니다. 이러한 수치는 프로젝트 자체 문서 및 벤치마크 저장소에서 온 것으로 여기서 독립적으로 검증된 것은 아닙니다.
README에서 명시된 대상 사용 사례는 재무 보고서, 법적 문서, 규제 신고서, 기술 매뉴얼, 의학 문헌 및 학술 교재입니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.