इस प्रोजेक्ट के बारे में
LightRAG एक ओपन-सोर्स रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) फ्रेमवर्क है जो नॉलेज ग्राफ के इर्द-गिर्द बना है, और इसे Microsoft GraphRAG के हल्के विकल्प के रूप में प्रस्तुत किया गया है। यह ग्राफ-आधारित संरचित इंडेक्सिंग को वेक्टर एम्बेडिंग के साथ दो-स्तरीय आर्किटेक्चर में जोड़ता है, जिसका उद्देश्य पारंपरिक चंक-आधारित वेक्टर RAG और ग्राफ-आधारित RAG के बीच की खाई को पाटना है।
README में वर्णित मुख्य क्षमताएँ:
- ग्राफ-संरचित इंडेक्सिंग जो संस्थाओं के बीच सिमेंटिक निर्भरताओं को कैप्चर करती है, जिसका उद्देश्य चंक-आधारित पुनर्प्राप्ति में खंडित संदर्भ की समस्या को दूर करना है।
- दो-स्तरीय पुनर्प्राप्ति के साथ पाँच क्वेरी मोड: लोकल (विशिष्ट संस्थाएँ और विशेषताएँ), ग्लोबल (मैक्रो थीम और क्रॉस-डॉक्यूमेंट संबंध), हाइब्रिड (लोकल + ग्लोबल), नेव (टेक्स्ट चंक्स पर सादा वेक्टर समानता), और मिक्स (लोकल + ग्लोबल + नेव, डिफ़ॉल्ट)।
- इंक्रीमेंटल अपडेट और चयनात्मक विलोपन: जब कोई दस्तावेज़ हटाया जाता है, तो सिस्टम इंडेक्सिंग-समय LLM कैश का उपयोग करके प्रभावित संस्थाओं और संबंधों को फिर से बना सकता है।
- कई दस्तावेज़ पार्सिंग इंजन: MinerU, Docling, और एक नेटिव इंजन जो Word और Markdown दस्तावेज़ों में छवियों, तालिकाओं और सूत्रों को संभालता है, साथ ही spaCy मॉडल का उपयोग करके .docx फ़ाइलों के लिए वैकल्पिक स्मार्ट हेडिंग डिटेक्शन।
- चार टेक्स्ट चंकिंग रणनीतियाँ: फिक्स्ड-लेंथ, रिकर्सिव कैरेक्टर, वेक्टर सिमेंटिक, और पैराग्राफ सिमेंटिक; अंतिम रणनीति चंक सीमाओं को हेडिंग, पैराग्राफ और तालिकाओं के साथ संरेखित करती है।
- मल्टीमॉडल प्रोसेसिंग (v1.5+) जो नॉलेज ग्राफ के माध्यम से छवियों, सूत्रों और तालिकाओं को बॉडी टेक्स्ट से जोड़ती है, और PDF, छवियों, Office दस्तावेज़ों, तालिकाओं और सूत्रों के लिए RAG-Anything एकीकरण।
- भूमिका-विशिष्ट LLM कॉन्फ़िगरेशन के साथ चार भूमिकाएँ: EXTRACT, QUERY, KEYWORD, और VLM, प्रत्येक स्वतंत्र रूप से कॉन्फ़िगर करने योग्य।
- स्टोरेज बैकएंड में लोकल फ़ाइल पर्सिस्टेंस के साथ इन-मेमोरी डिफ़ॉल्ट, साथ ही PostgreSQL, MongoDB, Neo4j, Milvus, OpenSearch और अन्य; प्रोडक्शन के लिए PostgreSQL अनुशंसित है।
- स्रोत आरोपण के लिए साइटेशन समर्थन, रीरैंकर समर्थन, RAGAS मूल्यांकन एकीकरण, और Langfuse ट्रेसिंग।
तैनाती और उपयोग:
- PyPI से lightrag-hku के रूप में api एक्स्ट्रा के साथ, या स्रोत से uv या pip का उपयोग करके इंस्टॉल किया जा सकता है; Makefile में make dev और make env-base जैसे टार्गेट उपलब्ध हैं।
- Docker Compose तैनाती समर्थित है, जिसमें Sigstore Cosign के माध्यम से हस्ताक्षरित आधिकारिक GHCR इमेज हैं; Apple Silicon के लिए Docker Desktop के बिना Apple Container सेटअप गाइड मौजूद है।
- एक इंटरैक्टिव सेटअप विज़ार्ड LLM, एम्बेडिंग, रीरैंकर, स्टोरेज, सर्वर, ऑथ और SSL सेटिंग्स के लिए .env और docker-compose.final.yml कॉन्फ़िगरेशन उत्पन्न करता है।
- सर्वर एक वेब UI और REST API प्रदान करता है; README चेतावनी देता है कि नेटवर्क एक्सपोज़र से पहले प्रमाणीकरण (LIGHTRAG_API_KEY या TOKEN_SECRET के साथ AUTH_ACCOUNTS) कॉन्फ़िगर किया जाना चाहिए, और Ollama-संगत /api/* रूट्स डिफ़ॉल्ट रूप से खुले रहते हैं जब तक कि WHITELIST_PATHS सेट न किया जाए।
- वैकल्पिक सिस्टम निर्भरताओं में नेटिव मार्कडाउन/टेक्स्टपैक पार्सिंग में SVG रैस्टराइज़ेशन के लिए libcairo, और docx स्मार्ट हेडिंग के लिए spaCy भाषा मॉडल शामिल हैं।
README में मॉडल मार्गदर्शन बताता है कि निष्कर्षण के लिए तेज़ नॉन-थिंकिंग मॉडल, क्वेरी उत्तर देने के लिए मजबूत मॉडल, कीवर्ड निष्कर्षण के लिए हल्का नॉन-थिंकिंग मॉडल, और VLM कार्यों के लिए मल्टीमॉडल मॉडल उपयोग करें; एम्बेडिंग मॉडल इंडेक्सिंग से पहले चुने जाने चाहिए और सुसंगत रखे जाने चाहिए, स्थानीय तैनाती के लिए BAAI/bge-m3 सुझाया गया है। परियोजना एक arXiv पेपर (2410.05779) से जुड़ी है और इसे EMNLP 2025 में स्वीकृत बताया गया है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.