इस प्रोजेक्ट के बारे में

CocoIndex लॉन्ग-होराइजन AI एजेंट्स के लिए एक इन्क्रिमेंटल इंजन है जो विभिन्न डेटा स्रोतों—कोडबेस, मीटिंग नोट्स, Slack, PDFs और वीडियो सहित—को LLM एप्लिकेशन के लिए लाइव, अप-टू-डेट कंटैक्स्ट में बदलता है। यह एक डिक्लेरेटिव Python-ne티브 दृष्टिकोण का उपयोग करता है जहां उपयोगकर्ता वांछित टार्गेट स्टेट को परिभाषित करते हैं, और इंजन सिर्फ़ डेल्टा (परिवर्तनों) को प्रोसेस करके सिंक सुनिश्चित करता है, पूरे डेटासेट को फिर से इंडेक्स किए बिना। मुख्य क्षमताएं: - इन्क्रिमेंटल प्रोसेसिंग: अपरिवर्तित डेटा को कैश करते हुए और केवल संशोधित सोर्स बाइट्स या अपडेटेड कोड पर ही ट्रांसफॉर्मेशन को फिर से चलाने द्वारा कंप्यूट और एम्बेडिंग लागत को कम करता है। - एंड-टू-एंड लाइनज: ऑडिटिंग और डिबगिंग के लिए टार्गेट वेक्टर या ग्राम नोड्स से लेकर सटीक सोर्स बाइट तक ट्रैसेबिलिटी प्रदान करता है। - विविध कनेक्टर: व्यापक स्रोतों (Local FS, Blob Stores, Databases, Message Queues) और टार्गेट स्टोर्स (Relational DBs, Vector DBs, Graph DBs, Feature Stores) का समर्थन करता है। - प्रोडक्शन-रेडी कोर: विश्वसनीयता प्रदान करने के लिए Rust कोर के साथ निर्मित, जिसमें रेट्री लूप, एक्सपोनेंशियल बैक-ऑफ़ और डेड-लेटर क्यूस शामिल हैं। सामान्य उपयोग के मामले कोडिंग एजेंट्स के लिए AST-अवेयर सेमैंटिक कोड इंडेक्स बनाना, PDF दस्तावेज़ों के लिए RAG पाइपलाइंस, Hacker News से स्वचालित विषय निकालना, और मीटिंग ट्रांसक्रिप्ट्स को नॉलेज ग्राम्स में परिवर्तित करना शामिल हैं।