প্রকল্প সম্পর্কে

bncc-benchmark BNCC (Base Nacional Comum Curricular) সম্পর্কিত এলএলএম হ্যালুসিনেশনের একটি পাবলিক বেঞ্চমার্ক। এটি একটি উন্মুক্ত পদ্ধতি এবং প্রকাশিত কাঁচা ডেটার মাধ্যমে পরিমাপ করে যে, যখন কোনো মডেলকে কাঠামোগত উৎস ছাড়াই প্রশ্ন করা হয়, তখন তারা কতটা ভুল কোড বা পাঠ্য তৈরি করে। এছাড়া bncc.dev (MCP এবং API) এর মাধ্যমে গ্রাউন্ডিং ব্যবহার করলে এই সমস্যা কতটা কমে তাও এটি যাচাই করে। অফিসিয়াল রাউন্ড অফিসিয়াল রাউন্ড 'oficial-seca-2026-08'-এ ১৯টি মডেলের প্রতিটির ৯০০টি করে উত্তর (মোট ১৭,১০০টি কাঁচা উত্তর) পরিমাপ করা হয়েছে। কোনো উৎস ছাড়াই BNCC-এর একটি দক্ষতার সঠিক পাঠ্য জানতে চাওয়া হয়েছিল; মডেল অনুযায়ী সঠিক উত্তরের হার ৯০% থেকে ০% পর্যন্ত পরিবর্তিত হয়েছে। শীর্ষ ৫টি মডেল মডেল | স্কোর | সঠিক পাঠ্য | ভুল কোড গ্রহণ GPT-5.6 Sol · OpenAI | ৮৬.৪ | ৯০% | ২৫% Claude Fable 5 · Anthropic | ৮০.২ | ৭৭% | ৩% Gemini 3.1 Pro · Google | ৭৬.০ | ৬১% | ৪% Claude Opus 5 · Anthropic | ৭৫.০ | ৬৭% | ৪% GPT-5.6 Luna · OpenAI | ৭৩.৮ | ৭৫% | ৪৩% স্কোর পাঁচটি মাত্রার গড়: সঠিক কোড শনাক্তকরণ, ভুল কোড প্রত্যাখ্যান, পাঠ্যের বিশ্বস্ততা, বিপরীত লুকআপ এবং উন্মুক্ত জেনারেশনে সঠিক উদ্ধৃতি। র‍্যাঙ্কিং থেকে দুটি শিক্ষা: (১) উচ্চ স্কোর মানেই নির্ভরযোগ্যতা নয়—প্রথম স্থান অধিকারী মডেলটিও ২৫% ভুল কোডকে সঠিক হিসেবে গ্রহণ করেছে; (২) সঠিক পাঠ্য দেওয়া এবং ভুল তথ্য প্রত্যাখ্যান করা দুটি ভিন্ন দক্ষতা। ইন্টারভেনশন এবং হেল্ড-আউট ইন্টারভেনশন স্টাডিতে দেখা গেছে: - উৎস ছাড়া: ৩১.৯% হ্যালুসিনেশন - প্রম্পটে ডেটা দিলে (টুল ছাড়া): ০.২% - MCP (bncc.dev) ব্যবহার করলে: ২.৩% একটি ব্যক্তিগত 'হেল্ড-আউট' সেট রয়েছে যা দিয়ে যাচাই করা হয় যে মডেলের উচ্চ পারফরম্যান্স মুখস্থ করার কারণে নাকি প্রকৃত শিক্ষার কারণে। যা পরিমাপ করা হয় কাজ | সাধারণ প্রশ্ন | পরিমাপের বিষয় A · সরাসরি লুকআপ | EF67LP08 দক্ষতার পাঠ্য কী? | উদ্ভাবিত বা ভুল পাঠ্য B · অস্তিত্ব | BNCC-তে কি X দক্ষতা আছে? | ভুল-বিশ্বাসযোগ্য কোড গ্রহণ C · উন্মুক্ত জেনারেশন | ৭ম শ্রেণির গণিতের ৫টি দক্ষতা তালিকাভুক্ত করুন | বাস্তব ব্যবহারে উদ্ভাবিত কোড D · বিপরীত লুকআপ | এই পাঠ্যটির কোড কী? | বিপরীত দিকে মুখস্থ করার ক্ষমতা রিপোজিটরি কাঠামো harness/ - বেঞ্চমার্ক কোড (জেনারেটর, রানার, মূল্যায়ন) itens/ - সংস্করণযুক্ত আইটেম ব্যাংক resultados/ - কাঁচা উত্তর (JSONL) এবং ফলাফল METODOLOGIA.md - সম্পূর্ণ প্রোটোকল DECISOES.md - ডিজাইনের সিদ্ধান্তসমূহ ব্যবহার pnpm install pnpm test pnpm gerar pnpm executar --rodada smoke --modelos claude-haiku --limite 10 pnpm avaliar --rodada smoke pnpm agregar --rodada smoke লাইসেন্স এবং রক্ষণাবেক্ষণ কোড: MIT। আইটেম, ফলাফল এবং পদ্ধতি: CC BY 4.0। Profy দ্বারা রক্ষণাবেক্ষণ করা হয়। স্বচ্ছতার স্বার্থে পদ্ধতি, আইটেম এবং কাঁচা উত্তরগুলো সর্বজনীন এবং পুনরায় গণনাযোগ্য।