इस प्रोजेक्ट के बारे में

# bncc-benchmark BNCC (ब्राज़ील का राष्ट्रीय साझा पाठ्यक्रम आधार) पर LLM हैलुसिनेशन का सार्वजनिक बेंचमार्क। यह खुली पद्धति और प्रकाशित कच्चे डेटा के सा मापता है कि भाषा मॉडल, संरचित स्रोत तक पहुँच के बिना उत्तर देते समय, BNCC के कितने कोड और पाठ गढ़ते हैं, और bncc.dev (MCP और API) के ज़रिए grounding मिलने पर यह समस्या कितनी घट जाती है। ## आधिकारिक राउंड रांड `oficial-seca-2026-08` ने 19 मॉडल × 900 उत्तर प्रत्येक (17.100 कच्चे उत्तर) मापे। BNCC के किसी कौशल का सटीक पाठ पूछा जाता है, स्रोत तक पहुँच दिए बिना; आधिकारिक पा के प्रति faithful उत्तरों की दर मॉडल के अनुसार 90% से 0% तक रहती है। ### शीर्ष (5 मॉडल) | मॉडल | स्कोर | मूल पाठ के अनुरूप | गलत कोड स्वीकार किए | |---|---|---|---| | GPT-5.6 Sol · OpenAI | 86,4 | 90% | 25% | | Claude Fable 5 · Anthropic | 80,2 | 77% | 3% | | Gemini 3.1 Pro · Google | 76,0 | 61% | 4% | | Claude Opus 5 · Anthropic | 75,0 | 67% | 4% | | GPT-5.6 Luna · OpenAI | 73,8 | 75% | 43% | स्कोर पाँच आयामों का औसत है: वास्तविक कोड पहचानना, गलत कोड अस्वीकार करना, पाठ की faithfulता, उल्टा lookup और खुली जनरेशन में सही उद्धरण। रैंकिंग की दो सीखें: (1) ऊँचा स्कोर भरोसे का मतलब नहीं है — पहले स्थान वाला मॉडल अब भी 25% गलत कोडों को असली मान लेता है; (2) पाठ सही करना और गढ़ंत अस्वीकार करना अलग-अलग क्षमताए हैं, इसीलिए अंक बिखरे हुए हैं। GPT-5.6 Luna और Claude Fable 5 की faithfulता समान है (75% बनाम 77%), पर पहला 43% गढ़े गए कोड स्वीकार करता है और दूसरा केवल 3%। ## हस्तक्षेप और held-out हस्तक्षेप अध्ययन (8 मॉडल, 300 आइटम, तीन paired स्थितियाँ) दिखाता है: - स्रोत के बिना: 31,9% उत्तरों में हैलुसिनेशन - prompt में डेटा दिया गया (बिना टूल): 0,2% - MCP (bncc.dev) से परामर् करते हुए: 2,3% एक निजी held-out सेट मौजूद है (कभी प्रकाशित नहीं), जो यह पकड़ने के लिए है कि सार्वजनिक सेट पर बेहतर प्रदर्शन memorization से आता है या BNCC के वास्तविक सीखने से। ## क्या मापा जाता है | कार्य | विशिष्ट प्रश्न | क्या मापता है | |---|---|---| | A · सीधा lookup | “कौशल EF67LP08 का पाठ क्या है?” | गढ़ा या बदला गया पा | | B · अस्तित्व | “क्या कौशल X BNCC में मौजूद है?” | गलत-संभाव्य कोडों की स्वीकृति | | C · खुली जनरेशन | “गणित के 7वें वर्ष के 5 कौशल सूचीबद्ध करें” | वास्तविक उपयोग में ग़े गए कोड | | D · उल्टा lookup | “इस कौशल का कोड क्या है?” (पाठ दिया गया) | उलटी दिशा में memorization | गाबारिटो bncc.dev का सत्यापित डेटासेट है (`@bncc/dados`, 1.721 शिक्षण-बिंदु जो आधिकारिक दस्तावेज़ तक traceable हैं)। कार्य B के गलत कोड आधिकारिक नंबरिंग के वैध अंतरालों से बनाए जाते हैं। ## रिपॉज़िटरी की संरचना harness/ — बेंचमार्क कोड (जेनरेटर, रनर, मूल्यांकन, एग्रीगेशन) itens/ — वर्ज़न किया गया आइटम बैंक resultados/ — कच्चे उत्तर (JSONL) और एग्रीगेट, प्रति राउंड METODOLOGIA.md — पूरा प्रोटोकॉल DECISOES.md — क्रमांकित डि़ाइन निर्णय ## उपयोग pnpm install pnpm test pnpm gerar pnpm executar --rodada smoke --modelos claude-haiku --limite 10 pnpm avaliar --rodada smoke pnpm agregar --rodada smoke pnpm agregar --rodada smoke --verificar # CI द्वारा उपयोग किया जाने वाला check स्थानीय रूप से चलाया जाता है; CI केवल typecheck, टेस्ट और परिामों की संगति जाँच चलाता है। प्रोवाइडर की keys `.env` में (कभी commit नहीं की जातीं)। ## लाइसेंस और रखरखाव कोड: MIT. आइटम, परिणाम और पद्धति: CC BY 4.0. रखरखाव Profy (https://www.profy.ai/) द्वारा — एक घोषित हित-संघर्ष मौजूद है (Profy ऐसे उत्पाद चलाती है जो BNCC पर LLM का उपयोग करते हैं), जिसकी भरपाई पूरी पारदर्शिता से होती है: पद्धति, आइटम, कच्चे उत्तर और निर्णय सार्वजनिक और पुनर्गणनीय हैं, और CI किसी भी मैन्युअल रूप से संपादित स्कोर को अस्वीकार करता है। प्रकाशित राउंड अपरिवर्तनीय हैं।