इस प्रोजेक्ट के बारे में

PageIndex एक ओपन-सोर्स रिट्रिवल-ऑगमेंटेड जेनरेशन (RAG) इंजन है जो वेक्टर समानता खोज को पदानुक्रमित ट्री इंडेक्स और LLM तर्क से बदल देता है। परियोजना का तर्क है कि समानता प्रासंगिकता के समान नहीं है, और लंबे पेशेवर दस्तावेजों पर प्रासंगिकता के लिए एम्बेडिंग लुकअप के बजाय तर्क की आवश्यकता होती है। कैसे काम करता है: पुनःप्राप्ति दो चरणों में होती है। पहले, एक इंडेक्स चरण प्रत्येक दस्तावेज़ के लिए एक ट्री-स्ट्रक्चर इंडेक्स उत्पन्न करता है। दूसरे, एक पुनःप्राप्ति चरण एजेंटिक रूप से LLM तर्क का उपयोग करके उस ट्री की खोज करता है, जो एक मानव विशेषज्ञ द्वारा एक लंबी रिपोर्ट को नेविगेट करने के समान है। README बताता है कि ट्री संरचना दस्तावेज़ लेआउट से LLM के बिना निकाली जाती है, जबकि इंडेक्स मॉडल केवल इसे संक्षिप्त और सुधारता है, इसलिए इंडेक्स समय पर एक बुनियादी मॉडल पर्याप्त माना जाता है। चैट मॉडल, जो ट्री की खोज करता है, वही है जहाँ README सर्वोत्तम उपलब्ध मॉडल का उपयोग करने की सिफारिश करता है। स्थापना और उपयोग: SDK को pip install -U pageindex के साथ स्थापित किया जाता है। एक PageIndexClient को एक इंडेक्स मॉडल और एक चैट मॉडल के साथ कॉन्फ़िगर किया जाता है, एक दस्तावेज़ जमा करके एक doc_id प्राप्त किया जाता है, और प्रश्न client.chat() के माध्यम से पूछे जाते हैं। README एक स्थानीय मोड का उल्लेख करता है जो उपयोगकर्ता की मशीन पर उनके włas LLM कुंजी के साथ इंडेक्सिंग, पुनःप्राप्ति और चैट चलाता है, और एक क्लाउड मोड जो उसी क्लाइंट को API कुंजी का उपयोग करके PageIndex Cloud की ओर इशारा करता है। क्लाउड मोड को पार्सिंग, OCR, छवि समझ, ट्री-इंडेक्स निर्माण और प्रबंधित स्टोरेज को संभालने के रूप में वर्णित किया गया है, जिसमें लाइन-स्तर के संदर्भ और एक MCP सर्वर शामिल है, जबकि स्थानीय मोड को पाठ-भारी PDFs और पृष्ठ-स्तर के संदर्भ वाले स्थानीय वर्कफ़्लो के लिए स्थित किया गया है। README एजेंट फ्रेमवर्क जैसे OpenAI Agents SDK और Claude Agent SDK के साथ एकीकरण का भी वर्णन करता है, और एक PageIndex फ़ाइल सिस्टम लेयर जो एकल दस्तावेज़ के बजाय पूरे कॉर्पस पर तर्क करने के लिए है। README में रिपोर्ट किए गए बेंचमार्क में प्रति पेज लगभग $0.001 की स्थानीय इंडेक्सिंग लागत, 9 से 1,098 पृष्ठों वाले दस्तावेज़ों के लिए लगभग 13 सेकंड से 4.5 मिनट तक की इंडेक्सिंग समय, एक तुलना जो दावा करती है कि natिव PDF इनपुट 52 पृष्ठों पर 2.1x अधिक और 420 पृष्ठों पर 16.6x अधिक खर्च करता है, और FinanceBench पर रिपोर्ट की गई 98.7% सटीकता शामिल है। ये आंकड़े परियोजना के włas दस्तावेज़ और बेंचमार्क रिपॉजिटरी से आते हैं और यहाँ स्वतंत्र रूप से सत्यापित नहीं किए गए हैं। README में नामित लक्ष्य उपयोग केस वित्तीय रिपोर्ट, कानूनी दस्तावेज़, नियामक फाइलें, तकनीकी मैनुअल, चिकित्सा साहित्य और शैक्षिक पाठ्यपुस्तकें शामिल हैं।