ब्राज़ील के BNCC (राष्ट्रीय साझा पाठ्यक्रम आधार) पर LLM हैलुसिनेशन का खुला बेंचमार्क। यह मापता है कि मॉडल कितने आधिकारिक कोड और पाठ गढ़ते हैं, खुली पद्धति, कच्चे डेटा और ऑडिट योग्य CI के साथ।
ओपन सोर्स। नई संभावनाएँ।
उत्कृष्ट ओपन-सोर्स प्रोजेक्ट खोजें, गुमनाम रूप से प्रोजेक्ट सबमिट करें और अपने प्रोजेक्ट का दावा कर उसे संपादित करें।
जिज्ञासा के साथ ओपन सोर्स खोजें।
THE FIRST COLLECTIONसचिन के लिए GitHub प्रोफाइल README, जो खुद को एक एप्लाइड AI आर्किटेक्ट और इंजीनियर बताते हैं। यह एजेंट, RAG, मूल्यांकन और विश्वसनीयता टूलिंग से संबंधित ओपन-सोर्स प्रोजेक्ट्स, कौशल और संपर्क विवरण दर्शाता है।
AgentLeak एक ओपन-सोर्स गोपनीयता परीक्षण उपकरण है जो AI एजेंटों के लिए है। यह टूल कॉल, मेमोरी और लॉग में डेटा लीक का पता लगाता है, स्थानीय Python SDK, CLI और MCP टूल्स का उपयोग करके, बिना क्लाउड निर्भरता के रिडैक्टेड रिपोर्ट और CI गेट्स प्रदान करता है।
SUM एक ओपन-सोर्स टूल है जो क्रिप्टोग्राफ़िक रसीदों के साथ AI टेक्स्ट परिवर्तनों को सत्यापित करता है। यह जाँचता है कि AI द्वारा टेक्स्ट को फिर से लिखने पर क्या बदला, क्या संरक्षित रहा और क्या खो गया, साथ ही क्रॉस-रनटाइम Ed25519 हस्ताक्षर और ऑफ़लाइन सत्यापन।
garak, NVIDIA का एक ओपन-सोर्स LLM भेद्यता स्कैनर है जो जनरेटिव AI मॉडलों में भ्रम, डेटा लीकेज, प्रॉम्प्ट इंजेक्शन, विषाक्तता, जेलब्रेक और अन्य कमजोरियों की जांच करता है, जो भावना में nmap या Metasploit जैसा है लेकिन LLM के लिए।
iFixAi AI एजेंट्स का स्वतंत्र ऑडिटिंग करता है और एक संरचित स्कोरिंग प्रणाली के माध्यम से यह आकलन करता है कि क्या कोई एजेंट व्यावसायिक KPIs और संगठनात्मक संरचनाओं का पालन कर रहा है।
DeepEval एक ओपन-सोर्स LLM मूल्यांकन फ्रेमवर्क है जो RAG पाइपलाइन, एजेंट और चैटबॉट सहित AI एप्लिकेशन के यूनिट टेस्टिंग के लिए डिज़ाइन किया गया है।