عن المشروع
# bncc-benchmark
معيار عام لهلوسة نماذج اللغة الكبيرة (LLMs) حول BNCC (القاعدة الوطنية المشتركة للمناهج الدراسية). يقيس، بمنهجية مفتوحة وبيانات خام منشورة، مدى اختلاق نماذج اللغة لأكواد ونصوص BNCC عندما تجيب دون الوصول إلى المصدر المنظم، ومدى اختفاء المشكلة عند الاستناد إلى bncc.dev (MCP و API).
## الجولة الرسمية
قاست الجولة `oficial-seca-2026-08` **19 نموذجًا × 900 إجابة لكل نموذج** (17,100 إجابة خام). يُسأل عن النص الدقيق لمهارة من BNCC دون إعطاء الوصول إلى المصدر؛ يتراوح معدل الإجابات المطابقة للنص الرسمي من 90% إلى 0% حسب النموذج.
### الأعلى (5 نماذج)
| النموذج | الدرجة | نص مطابق | قبل كودًا خاطئًا |
|---|---|---|---|
| GPT-5.6 Sol · OpenAI | 86,4 | 90% | 25% |
| Claude Fable 5 · Anthropic | 80,2 | 77% | 3% |
| Gemini 3.1 Pro · Google | 76,0 | 61% | 4% |
| Claude Opus 5 · Anthropic | 75,0 | 67% | 4% |
| GPT-5.6 Luna · OpenAI | 73,8 | 75% | 43% |
*الدرجة* هي متوسط خمسة أبعاد: التعرف على الأكواد الحقيقية، رفض الأكواد المزيفة، دقة النص، البحث العكسي، والاستشهاد الصحيح في التوليد المفتوح.
**درسان من التصنيف:** (1) الدرجة العالية لا تعني الثقة — الأول في الترتيب لا يزال يقبل 25% من الأكواد المزيفة كحقيقية؛ (2) إصابة النص ورفض الاختلاقات هما مهارتان متميزتان، ولهذا تتوزع النقاط. يتمتع GPT-5.6 Luna و Claude Fable 5 بدقة متشابهة (75% مقابل 77%)، لكن الأول يقبل 43% من الأكواد المختلقة والثاني 3% فقط.
## التدخلات والمجموعة المحجوزة (held-out)
أظهرت دراسة التدخل (8 نماذج، 300 عنصر، ثلاث حالات متطابقة):
- بدون مصدر: **31.9%** من الإجابات مع هلوسة
- معطى في الموجه (بدون أداة): **0.2%**
- بالرجوع إلى MCP (bncc.dev): **2.3%**
توجد مجموعة **held-out خاصة** (لم تُنشر أبدًا) للكشف عما إذا كان الأداء المتفوق في العام ناتجًا عن الحفظ أو التعلم الحقيقي لـ BNCC.
## ما يتم قياسه
| المهمة | سؤال نموذجي | يقيس |
|---|---|---|
| أ · بحث مباشر | "ما هو نص المهارة EF67LP08؟" | نص مختلق أو متبادل |
| ب · وجود | "هل المهارة X موجودة في BNCC؟" | قبول أكواد مزيفة-معقولة |
| ج · توليد مفتوح | "اذكر 5 مهارات رياضيات للصف السابع" | أكواد مختلقة في الاستخدام الفعلي |
| د · بحث عكسي | "ما هو كود هذه المهارة؟" (معطى النص) | الحفظ في الاتجاه العكسي |
المفتاح هو مجموعة البيانات الموثقة من bncc.dev (`@bncc/dados`، 1,721 تعلمًا يمكن تتبعها إلى الوثيقة الرسمية). تُبنى الأكواد المزيفة للمهمة B من الفجوات المشروعة في الترقيم الرسمي.
## هيكل المستودع
```
harness/ كود المعيار (المولد، المشغل، التقييم، التجميع)
itens/ بنك العناصر المُرَوَّج
resultados/ الإجابات الخام (JSONL) والمجمعة، لكل جولة
METODOLOGIA.md البروتوكول الكامل
DECISOES.md قرارات التصميم المرقمة
```
## الاستخدام
```bash
pnpm install
pnpm test
pnpm gerar
pnpm executar --rodada smoke --modelos claude-haiku --limite 10
pnpm avaliar --rodada smoke
pnpm agregar --rodada smoke
pnpm agregar --rodada smoke --verificar # check usado pelo CI
```
التنفيذ المحلي؛ يقوم CI بتشغيل التحقق من النوع والاختبارات والتحقق من اتساق النتائج فقط. مفاتيح المزودين في `.env` (لا تُرفع أبدًا).
## التراخيص والصيانة
الكود: MIT. العناصر، النتائج، والمنهجية: CC BY 4.0. يتم صيانته بواسطة [Profy](https://www.profy.ai/) — يوجد تضارب مصالح معلن (Profy تدير منتجات تستخدم LLMs حول BNCC)، يتم تعويضه بالشفافية الكاملة: المنهجية، العناصر، الإجابات الخام، والأحكام عامة وقابلة لإعادة الحساب، ويرفض CI أي درجة تم تعديلها يدويًا. الجولات المنشورة غير قابلة للتغيير.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.