প্রকল্প সম্পর্কে
bncc-benchmark
BNCC (Base Nacional Comum Curricular) সম্পর্কিত এলএলএম হ্যালুসিনেশনের একটি পাবলিক বেঞ্চমার্ক। এটি একটি উন্মুক্ত পদ্ধতি এবং প্রকাশিত কাঁচা ডেটার মাধ্যমে পরিমাপ করে যে, যখন কোনো মডেলকে কাঠামোগত উৎস ছাড়াই প্রশ্ন করা হয়, তখন তারা কতটা ভুল কোড বা পাঠ্য তৈরি করে। এছাড়া bncc.dev (MCP এবং API) এর মাধ্যমে গ্রাউন্ডিং ব্যবহার করলে এই সমস্যা কতটা কমে তাও এটি যাচাই করে।
অফিসিয়াল রাউন্ড
অফিসিয়াল রাউন্ড 'oficial-seca-2026-08'-এ ১৯টি মডেলের প্রতিটির ৯০০টি করে উত্তর (মোট ১৭,১০০টি কাঁচা উত্তর) পরিমাপ করা হয়েছে। কোনো উৎস ছাড়াই BNCC-এর একটি দক্ষতার সঠিক পাঠ্য জানতে চাওয়া হয়েছিল; মডেল অনুযায়ী সঠিক উত্তরের হার ৯০% থেকে ০% পর্যন্ত পরিবর্তিত হয়েছে।
শীর্ষ ৫টি মডেল
মডেল | স্কোর | সঠিক পাঠ্য | ভুল কোড গ্রহণ
GPT-5.6 Sol · OpenAI | ৮৬.৪ | ৯০% | ২৫%
Claude Fable 5 · Anthropic | ৮০.২ | ৭৭% | ৩%
Gemini 3.1 Pro · Google | ৭৬.০ | ৬১% | ৪%
Claude Opus 5 · Anthropic | ৭৫.০ | ৬৭% | ৪%
GPT-5.6 Luna · OpenAI | ৭৩.৮ | ৭৫% | ৪৩%
স্কোর পাঁচটি মাত্রার গড়: সঠিক কোড শনাক্তকরণ, ভুল কোড প্রত্যাখ্যান, পাঠ্যের বিশ্বস্ততা, বিপরীত লুকআপ এবং উন্মুক্ত জেনারেশনে সঠিক উদ্ধৃতি।
র্যাঙ্কিং থেকে দুটি শিক্ষা: (১) উচ্চ স্কোর মানেই নির্ভরযোগ্যতা নয়—প্রথম স্থান অধিকারী মডেলটিও ২৫% ভুল কোডকে সঠিক হিসেবে গ্রহণ করেছে; (২) সঠিক পাঠ্য দেওয়া এবং ভুল তথ্য প্রত্যাখ্যান করা দুটি ভিন্ন দক্ষতা।
ইন্টারভেনশন এবং হেল্ড-আউট
ইন্টারভেনশন স্টাডিতে দেখা গেছে:
- উৎস ছাড়া: ৩১.৯% হ্যালুসিনেশন
- প্রম্পটে ডেটা দিলে (টুল ছাড়া): ০.২%
- MCP (bncc.dev) ব্যবহার করলে: ২.৩%
একটি ব্যক্তিগত 'হেল্ড-আউট' সেট রয়েছে যা দিয়ে যাচাই করা হয় যে মডেলের উচ্চ পারফরম্যান্স মুখস্থ করার কারণে নাকি প্রকৃত শিক্ষার কারণে।
যা পরিমাপ করা হয়
কাজ | সাধারণ প্রশ্ন | পরিমাপের বিষয়
A · সরাসরি লুকআপ | EF67LP08 দক্ষতার পাঠ্য কী? | উদ্ভাবিত বা ভুল পাঠ্য
B · অস্তিত্ব | BNCC-তে কি X দক্ষতা আছে? | ভুল-বিশ্বাসযোগ্য কোড গ্রহণ
C · উন্মুক্ত জেনারেশন | ৭ম শ্রেণির গণিতের ৫টি দক্ষতা তালিকাভুক্ত করুন | বাস্তব ব্যবহারে উদ্ভাবিত কোড
D · বিপরীত লুকআপ | এই পাঠ্যটির কোড কী? | বিপরীত দিকে মুখস্থ করার ক্ষমতা
রিপোজিটরি কাঠামো
harness/ - বেঞ্চমার্ক কোড (জেনারেটর, রানার, মূল্যায়ন)
itens/ - সংস্করণযুক্ত আইটেম ব্যাংক
resultados/ - কাঁচা উত্তর (JSONL) এবং ফলাফল
METODOLOGIA.md - সম্পূর্ণ প্রোটোকল
DECISOES.md - ডিজাইনের সিদ্ধান্তসমূহ
ব্যবহার
pnpm install
pnpm test
pnpm gerar
pnpm executar --rodada smoke --modelos claude-haiku --limite 10
pnpm avaliar --rodada smoke
pnpm agregar --rodada smoke
লাইসেন্স এবং রক্ষণাবেক্ষণ
কোড: MIT। আইটেম, ফলাফল এবং পদ্ধতি: CC BY 4.0। Profy দ্বারা রক্ষণাবেক্ষণ করা হয়। স্বচ্ছতার স্বার্থে পদ্ধতি, আইটেম এবং কাঁচা উত্তরগুলো সর্বজনীন এবং পুনরায় গণনাযোগ্য।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.