इस प्रोजेक्ट के बारे में
# bncc-benchmark
BNCC (ब्राज़ील का राष्ट्रीय साझा पाठ्यक्रम आधार) पर LLM हैलुसिनेशन का सार्वजनिक बेंचमार्क। यह खुली पद्धति और प्रकाशित कच्चे डेटा के सा मापता है कि भाषा मॉडल, संरचित स्रोत तक पहुँच के बिना उत्तर देते समय, BNCC के कितने कोड और पाठ गढ़ते हैं, और bncc.dev (MCP और API) के ज़रिए grounding मिलने पर यह समस्या कितनी घट जाती है।
## आधिकारिक राउंड
रांड `oficial-seca-2026-08` ने 19 मॉडल × 900 उत्तर प्रत्येक (17.100 कच्चे उत्तर) मापे। BNCC के किसी कौशल का सटीक पाठ पूछा जाता है, स्रोत तक पहुँच दिए बिना; आधिकारिक पा के प्रति faithful उत्तरों की दर मॉडल के अनुसार 90% से 0% तक रहती है।
### शीर्ष (5 मॉडल)
| मॉडल | स्कोर | मूल पाठ के अनुरूप | गलत कोड स्वीकार किए |
|---|---|---|---|
| GPT-5.6 Sol · OpenAI | 86,4 | 90% | 25% |
| Claude Fable 5 · Anthropic | 80,2 | 77% | 3% |
| Gemini 3.1 Pro · Google | 76,0 | 61% | 4% |
| Claude Opus 5 · Anthropic | 75,0 | 67% | 4% |
| GPT-5.6 Luna · OpenAI | 73,8 | 75% | 43% |
स्कोर पाँच आयामों का औसत है: वास्तविक कोड पहचानना, गलत कोड अस्वीकार करना, पाठ की faithfulता, उल्टा lookup और खुली जनरेशन में सही उद्धरण।
रैंकिंग की दो सीखें: (1) ऊँचा स्कोर भरोसे का मतलब नहीं है — पहले स्थान वाला मॉडल अब भी 25% गलत कोडों को असली मान लेता है; (2) पाठ सही करना और गढ़ंत अस्वीकार करना अलग-अलग क्षमताए हैं, इसीलिए अंक बिखरे हुए हैं। GPT-5.6 Luna और Claude Fable 5 की faithfulता समान है (75% बनाम 77%), पर पहला 43% गढ़े गए कोड स्वीकार करता है और दूसरा केवल 3%।
## हस्तक्षेप और held-out
हस्तक्षेप अध्ययन (8 मॉडल, 300 आइटम, तीन paired स्थितियाँ) दिखाता है:
- स्रोत के बिना: 31,9% उत्तरों में हैलुसिनेशन
- prompt में डेटा दिया गया (बिना टूल): 0,2%
- MCP (bncc.dev) से परामर् करते हुए: 2,3%
एक निजी held-out सेट मौजूद है (कभी प्रकाशित नहीं), जो यह पकड़ने के लिए है कि सार्वजनिक सेट पर बेहतर प्रदर्शन memorization से आता है या BNCC के वास्तविक सीखने से।
## क्या मापा जाता है
| कार्य | विशिष्ट प्रश्न | क्या मापता है |
|---|---|---|
| A · सीधा lookup | “कौशल EF67LP08 का पाठ क्या है?” | गढ़ा या बदला गया पा |
| B · अस्तित्व | “क्या कौशल X BNCC में मौजूद है?” | गलत-संभाव्य कोडों की स्वीकृति |
| C · खुली जनरेशन | “गणित के 7वें वर्ष के 5 कौशल सूचीबद्ध करें” | वास्तविक उपयोग में ग़े गए कोड |
| D · उल्टा lookup | “इस कौशल का कोड क्या है?” (पाठ दिया गया) | उलटी दिशा में memorization |
गाबारिटो bncc.dev का सत्यापित डेटासेट है (`@bncc/dados`, 1.721 शिक्षण-बिंदु जो आधिकारिक दस्तावेज़ तक traceable हैं)। कार्य B के गलत कोड आधिकारिक नंबरिंग के वैध अंतरालों से बनाए जाते हैं।
## रिपॉज़िटरी की संरचना
harness/ — बेंचमार्क कोड (जेनरेटर, रनर, मूल्यांकन, एग्रीगेशन)
itens/ — वर्ज़न किया गया आइटम बैंक
resultados/ — कच्चे उत्तर (JSONL) और एग्रीगेट, प्रति राउंड
METODOLOGIA.md — पूरा प्रोटोकॉल
DECISOES.md — क्रमांकित डि़ाइन निर्णय
## उपयोग
pnpm install
pnpm test
pnpm gerar
pnpm executar --rodada smoke --modelos claude-haiku --limite 10
pnpm avaliar --rodada smoke
pnpm agregar --rodada smoke
pnpm agregar --rodada smoke --verificar # CI द्वारा उपयोग किया जाने वाला check
स्थानीय रूप से चलाया जाता है; CI केवल typecheck, टेस्ट और परिामों की संगति जाँच चलाता है। प्रोवाइडर की keys `.env` में (कभी commit नहीं की जातीं)।
## लाइसेंस और रखरखाव
कोड: MIT. आइटम, परिणाम और पद्धति: CC BY 4.0. रखरखाव Profy (https://www.profy.ai/) द्वारा — एक घोषित हित-संघर्ष मौजूद है (Profy ऐसे उत्पाद चलाती है जो BNCC पर LLM का उपयोग करते हैं), जिसकी भरपाई पूरी पारदर्शिता से होती है: पद्धति, आइटम, कच्चे उत्तर और निर्णय सार्वजनिक और पुनर्गणनीय हैं, और CI किसी भी मैन्युअल रूप से संपादित स्कोर को अस्वीकार करता है। प्रकाशित राउंड अपरिवर्तनीय हैं।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.