منصوبے کے بارے میں

# bncc-benchmark برازیلی قومی عام نصاب (BNCC) پر LLMs کی ہالوسینیشن کا عوامی بینچ مارک۔ یہ کھلی میتھڈولوجی اور شائع شدہ خام ڈیٹا کے ساتھ ماپتا ہے کہ بغیر ساختھا ماخذ تک رسائی کے جب زبان کے ماڈلز BNCC کے کوڈز اور تحریریں جواب دیتے ہیں تو وہ کتنی ایجاد کرتے ہیں، اور bncc.dev (MCP اور API) کے ذریعے گراؤنڈنگ کے ساتھ یہ مسئلہ کتنا ختم ہو جاتا ہے۔ ## رسمی راؤنڈ راؤنڈ `oficial-seca-2026-08` نے **19 ماڈلز × ہر ایک پر 900 جوابات** (17,100 خام جوابات) کا اندازہ لگایا۔ BNCC کی کسی مہارت کا درست تحریر پوچھا جاتا ہے بغیر ماخذ کی رسائی کے؛ وفاقی تحریر کے مطابق جوابات کی شرح ماڈل کے مطابق 90% سے 0% تک varies ہے۔ ### ٹاپ (5 ماڈلز) | ماڈل | نوٹ | وفاقی تحریر | جھوٹی کوڈ قبول کیا | |---|---|---|---| | GPT-5.6 Sol · OpenAI | 86.4 | 90% | 25% | | Claude Fable 5 · Anthropic | 80.2 | 77% | 3% | | Gemini 3.1 Pro · Google | 76.0 | 61% | 4% | | Claude Opus 5 · Anthropic | 75.0 | 67% | 4% | | GPT-5.6 Luna · OpenAI | 73.8 | 75% | 43% | *نوٹ* پانچ ابعاد کا اوسط ہے: حقیقی کوڈز کی پہچان، جھوٹے کو انکار کرنا، تحریر کی وفاداری، الٹے لوک اپ اور کھلی تخلیق میں درست حوالہ دینا۔ **رینکنگ سے دو سبق:** (1) اعلیٰ نوٹ کا مطلب اعتماد نہیں ہوتا — پہلے نمبر والا ماڈل بھی 25% جھوٹی کوڈز کو حقیقی مان لیتا ہے؛ (2) تحریر کا درست ہونا اور ایجادings کو انکار کرنا الگ الگ مہارتیں ہیں، اس لیے پوائنٹس پھیلے ہوئے ہیں۔ GPT-5.6 Luna اور Claude Fable 5 کی وفاداری میں مشابہت ہے (75% بمقابلہ 77%)، لیکن پہلا 43% ایجاد کردہ کوڈز قبول کرتا ہے اور دوسرا صرف 3%۔ ## مداخلت اور held-out مداخلتی تحقیق (8 ماڈلز، 300 آئٹمز، تین جوڑے حالات) نے دکھایا: - بغیر ماخذ کے: **31.9%** جوابات میں ہالوسینیشن ہے - پرومپٹ میں ڈیٹا دیا گیا (بغیر ٹول کے): **0.2%** - bncc.dev (MCP) سے استفسار کرتے ہوئے: **2.3%** ایک پرائیویٹ **held-out سیٹ** (کبھی شائع نہیں ہوا) موجود ہے تاکہ یہ پتہ لگایا جا سکے کہ عوامی سیٹ پر بہتر کارکردگی یاداشت سے ہے یا BNCC سے حقیقی سیکھنے سے۔ ## کیا ماپا جاتا ہے | کام | عام سوال | ماپتا ہے | |---|---|---| | A · براہ راست لوک اپ | "EF67LP08 مہارت کا تحریر کیا ہے؟" | ایجاد کردہ یا بدلہ ہوا تحریر | | B · وجود | "X مہارت BNCC میں موجود ہے؟" | حقیقی لگنے والی جھوٹی کوڈز کو قبول کرنا | | C · کھلی تخلیق | "7ویں کلاس کی ریاضی کی 5 مہارتیں لسٹ کریں" | حقیقی استعمال میں ایجاد کردہ کوڈز | | D · الٹا لوک اپ | "اس مہارت کا کوڈ کیا ہے؟" (تحریر دی گئی ہو) | الٹی سمت میں یاداشت | جواب کا کلید bncc.dev (`@bncc/dados`) کی تصدیق شدہ ڈیٹا سیٹ ہے، جس میں 1,721 سیکھنے کے آئٹمز سرکاری دستاویز سے ٹریس کرتے ہیں۔ کام B کی جھوٹی کوڈز سرکاری نمبرنگ کے قانونی خالی جگہوں سے بنائے گئے ہیں۔ ## ریپوزٹری کی ساخت ``` harness/ بینچ مارک کا کوڈ (جنریٹر، رنر، تشخیص، مجموعی) itens/ ورژن کردہ آئٹمز کا بینک resultados/ خام جوابات (JSONL) اور مجموعی، ہر راؤنڈ کے مطابق METODOLOGIA.md مکمل پروٹوکول DECISOES.md نمبر کردہ ڈیزائن کے فیصلے ``` ## استعمال ```bash pnpm install pnpm test pnpm gerar pnpm executar --rodada smoke --modelos claude-haiku --limite 10 pnpm avaliar --rodada smoke pnpm agregar --rodada smoke pnpm agregar --rodada smoke --verificar # CI کے ذریعے استعمال ہونے والا چیک ``` مقامی اجرا؛ CI صرف ٹائپ چیک، ٹیسٹس اور نتائج کی مستقل کی جانچ کرتا ہے۔ فراہم کنندگان کی keys `.env` میں ہیں (کبھی کمٹ نہیں کی جاتیں)۔ ## لائسنسز اور دیکھ بھال کوڈ: MIT۔ آئٹمز، نتائج اور میتھڈولوجی: CC BY 4.0۔ [Profy](https://www.profy.ai/) کے ذریعے برقرار رکھا جاتا ہے — اعلان کردہ تنازعہ موجود ہے (Profy ایسے پروڈکٹس چلاتا ہے جو BNCC پر LLMs استعمال کرتے ہیں)، جو مکمل شفافیت سے معاوضہ کیا گیا ہے: میتھڈولوجی، آئٹمز، خام جوابات اور فیصلے عوامی اور دوبارہ حساب کرنے کے قابل ہیں، اور CI کسی بھی دستی طور پر ترمیم شدہ نوٹ کو نامنظور کر دیتا ہے۔ شائع کردہ راؤنڈز غیرقابل تبدیل ہیں۔