इस प्रोजेक्ट के बारे में

GraphRAG एक डेटा पाइपलाइन और रूपांतरण सूट है जिसे बड़े भाषा मॉडल का उपयोग करके असंरचित पाठ से सार्थक, संरचित डेटा निकालने के लिए डिज़ाइन किया गया है। इसका मुख्य विचार ज्ञान ग्राफ मेमोरी संरचनाएँ बनाना है जिनका उपयोग प्रश्न-उत्तर के लिए लक्षित संदर्भ बनाने में किया जा सकता है, जिससे LLM की निजी या कथात्मक डेटा पर तर्क करने की क्षमता बढ़ती है। यह रिपॉज़िटरी Microsoft Research से है और इसे स्पष्ट रूप से एक शोध परियोजना बताया गया है, न कि आधिकारिक रूप से समर्थित Microsoft पेशकश। जुलाई 2024 में अपनी पहली रिलीज़ के बाद से, परियोजना काफी हद तक मेंटेनेंस मोड में आ गई है: यह नए पुल रिक्वेस्ट स्वीकार नहीं कर रही है या नई सुविधाँ लागू नहीं कर रही है, लेकिन मेंटेनर उपयुक्त रूप से बग फिक्स और डिपेंडेंसी अपडेट करेंगे, विशेष रूप से CVEs को संबोधित करने के लिए। शुरुआत करने के लिए आधिकारिक दस्तावेज़ में कमांड लाइन क्विकस्टार्ट की सिफारिश की जाती है। README दृढ़ता से चेतावनी देता है कि GraphRAG इंडेक्सिंग एक महँगा परेशन हो सकता है, और उपयोगकर्ताओं से आग्रह करता है कि वे सभी दस्तावेज़ पढ़ें, शामिल प्रक्रियां और लागतों को समें, और छोटी शुरुत करें। यह अपने डेटा के सा GraphRAG का उपयोग करते समय सर्वोत्तम परिाम पाने के लिए प्रॉम्प्ट ट्यूनिंग की भी सिफारिश करता है, क्योंकि आउट-फ-द-बॉक्स उपयोग इष्टतम परिणाम नहीं दे सकता है। वर्शनिंग मार्गदर्न एक ब्रेकिंग-चेंजेज़ दस्तावेज़ में दिया गया है। उपयोगकर्तां को सलाह दी जाती है कि वे माइनर वर्शन बंप के बीच नवीनतम कॉन्फ़ि प्रारूप सुनिश्चित करने के लिए graphrag init --root [path] --force चलाएँ, और प्रमुख वर्शन बंप के बीच प्रदान किया गया माइग्रेशन नोटबुक चलाएँ ताकि पहले के डेटासेट को फिर से इंडेक्स करने से बचा जा सके। यह कॉन्फ़िरेशन और प्रॉम्प्ट को वरराइट कर सकता है, इसलिए बैकअप की सिफारिश की जाती है। इस परियोजना में एक Responsible AI FAQ शामिल है जो बताता है कि GraphRAG क्या है, यह क्या कर सकता है, इच्छित उपयोग, मूल्यांकन मेट्रिक्स, सीमाए, और जिम्मेदार उपयोग के लिए परिचालन सेटिंग्स। यह Microsoft ट्रेडमार्क और गोपनीयता नीतियों का भी पालन करता है। कुल मिलाकर, GraphRAG ज्ञान ग्राफ को retrieval-augmented generation के साथ जोड़ने के लिए एक मॉड्यूलर दृष्टिकोण प्रदान करता है, लेकिन संभावित उपयोगकर्ताओं को अपनाने से पहले इसकी शोध स्थिति, मेंटेनेंस-मोड सीमाओं और संभावित रूप से महत्वपूर्ण इंडेक्सिंग लागतों के बारे में जागरूक होना चाहिए।