ब्राज़ील के BNCC (राष्ट्रीय साझा पाठ्यक्रम आधार) पर LLM हैलुसिनेशन का खुला बेंचमार्क। यह मापता है कि मॉडल कितने आधिकारिक कोड और पाठ गढ़ते हैं, खुली पद्धति, कच्चे डेटा और ऑडिट योग्य CI के साथ।
ओपन सोर्स। नई संभावनाएँ।
उत्कृष्ट ओपन-सोर्स प्रोजेक्ट खोजें, गुमनाम रूप से प्रोजेक्ट सबमिट करें और अपने प्रोजेक्ट का दावा कर उसे संपादित करें।
जिज्ञासा के साथ ओपन सोर्स खोजें।
THE FIRST COLLECTIONसचिन के लिए GitHub प्रोफाइल README, जो खुद को एक एप्लाइड AI आर्किटेक्ट और इंजीनियर बताते हैं। यह एजेंट, RAG, मूल्यांकन और विश्वसनीयता टूलिंग से संबंधित ओपन-सोर्स प्रोजेक्ट्स, कौशल और संपर्क विवरण दर्शाता है।
AgentLeak एक ओपन-सोर्स गोपनीयता परीक्षण उपकरण है जो AI एजेंटों के लिए है। यह टूल कॉल, मेमोरी और लॉग में डेटा लीक का पता लगाता है, स्थानीय Python SDK, CLI और MCP टूल्स का उपयोग करके, बिना क्लाउड निर्भरता के रिडैक्टेड रिपोर्ट और CI गेट्स प्रदान करता है।
MLflow एक ओपन-सोर्स AI इंजीनियरिंग प्लेटफॉर्म है जिसे एजेंटों, LLMs और पारंपरिक ML मॉडल के लाइफसाइकिल को प्रबंधित करने के लिए डिज़ाइन किया गया है, जो ऑब्जर्वेबिलिटी, मूल्यांकन और परिनियोजन पर केंद्रित है।
SUM एक ओपन-सोर्स टूल है जो क्रिप्टोग्राफ़िक रसीदों के साथ AI टेक्स्ट परिवर्तनों को सत्यापित करता है। यह जाँचता है कि AI द्वारा टेक्स्ट को फिर से लिखने पर क्या बदला, क्या संरक्षित रहा और क्या खो गया, साथ ही क्रॉस-रनटाइम Ed25519 हस्ताक्षर और ऑफ़लाइन सत्यापन।
garak, NVIDIA का एक ओपन-सोर्स LLM भेद्यता स्कैनर है जो जनरेटिव AI मॉडलों में भ्रम, डेटा लीकेज, प्रॉम्प्ट इंजेक्शन, विषाक्तता, जेलब्रेक और अन्य कमजोरियों की जांच करता है, जो भावना में nmap या Metasploit जैसा है लेकिन LLM के लिए।
iFixAi AI एजेंट्स का स्वतंत्र ऑडिटिंग करता है और एक संरचित स्कोरिंग प्रणाली के माध्यम से यह आकलन करता है कि क्या कोई एजेंट व्यावसायिक KPIs और संगठनात्मक संरचनाओं का पालन कर रहा है।
DeepEval एक ओपन-सोर्स LLM मूल्यांकन फ्रेमवर्क है जो RAG पाइपलाइन, एजेंट और चैटबॉट सहित AI एप्लिकेशन के यूनिट टेस्टिंग के लिए डिज़ाइन किया गया है।