À propos du projet
bncc-benchmark
Benchmark public d'hallucination des LLM sur la BNCC (Base Nacional Comum Curricular). Il mesure, avec une méthodologie ouverte et des données brutes publiées, dans quelle proportion les modèles de langage inventent des codes et des textes de la BNCC lorsqu'ils répondent sans accès à la source structurée, et dans quelle mesure le problème disparaît avec un grounding via bncc.dev (MCP et API).
Tour officiel
Le tour « oficial-seca-2026-08 » a mesuré 19 modèles × 900 réponses chacun (17 100 réponses brutes). On demande le texte exact d'une compétence de la BNCC sans donner accès à la source ; le taux de réponses fidèles au texte officiel varie de 90 % à 0 % selon le modèle.
Tête de classement (5 modèles)
| Modèle | Note | Texte fidèle | A accepté un code faux |
|---|---|---|---|
| GPT-5.6 Sol · OpenAI | 86,4 | 90 % | 25 % |
| Claude Fable 5 · Anthropic | 80,2 | 77 % | 3 % |
| Gemini 3.1 Pro · Google | 76,0 | 61 % | 4 % |
| Claude Opus 5 · Anthropic | 75,0 | 67 % | 4 % |
| GPT-5.6 Luna · OpenAI | 73,8 | 75 % | 43 % |
La Note est la moyenne de cinq dimensions : reconnaître des codes réels, refuser les faux, fidélité du texte, lookup inversé et citation correcte en génération ouverte.
Deux leçons du classement : (1) une note élevée n'implique pas la confiance — le premier accepte encore 25 % des codes faux comme réels ; (2) restituer correctement le texte et refuser les inventions sont des compétences distinctes, c'est pourquoi les points se dispersent. GPT-5.6 Luna et Claude Fable 5 ont une fidélité similaire (75 % contre 77 %), mais le premier accepte 43 % des codes inventés et le second seulement 3 %.
Interventions et held-out
L'étude d'intervention (8 modèles, 300 items, trois conditions appariées) a montré :
- Sans source : 31,9 % des réponses avec hallucination
- Donné dans le prompt (sans outil) : 0,2 %
- En consultant le MCP (bncc.dev) : 2,3 %
Il existe un ensemble held-out privé (jamais publié) pour détecter si une performance supérieure sur le public découle d'une mémorisation ou d'un apprentissage réel de la BNCC.
Ce qui est mesuré
| Tâche | Question typique | Mesure |
|---|---|---|
| A · lookup direct | « Quel est le texte de la compétence EF67LP08 ? » | texte inventé ou interverti |
| B · existence | « La compétence X existe-t-elle dans la BNCC ? » | acceptation de codes faux et plausibles |
| C · génération ouverte | « Liste 5 compétences de Mathématiques de 7e année » | codes inventés en usage réel |
| D · lookup inversé | « Quel est le code de cette compétence ? » (texte donné) | mémorisation dans le sens inverse |
Le corrigé est le dataset vérifié de bncc.dev (@bncc/dados, 1 721 apprentissages traçables au document officiel). Les codes faux de la tâche B sont construits à partir des lacunes légitimes de la numérotation officielle.
Structure du dépôt
harness/ code du benchmark (générateur, runner, évaluation, agrégation)
itens/ banque d'items versionnée
resultados/ réponses brutes (JSONL) et agrégats, par tour
METODOLOGIA.md protocole complet
DECISOES.md décisions de conception numérotées
Utilisation
pnpm install
pnpm test
pnpm gerar
pnpm executar --rodada smoke --modelos claude-haiku --limite 10
pnpm avaliar --rodada smoke
pnpm agregar --rodada smoke
pnpm agregar --rodada smoke --verificar # check utilisé par la CI
Exécution locale ; la CI exécute uniquement le typecheck, les tests et la vérification de cohérence des résultats. Clés des fournisseurs dans .env (jamais commitées).
Licences et maintenance
Code : MIT. Items, résultats et méthodologie : CC BY 4.0. Maintenu par Profy (https://www.profy.ai/) — il existe un conflit déclaré (Profy exploite des produits qui utilisent des LLM sur la BNCC), compensé par une transparence totale : méthodologie, items, réponses brutes et jugements sont publics et recalculables, et la CI rejette toute note éditée manuellement. Les tours publiés sont immuables.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.