Sobre el proyecto
# bncc-benchmark
Benchmark público de alucinación de LLMs sobre la BNCC (Base Nacional Comum Curricular). Mide, con metodología abierta y datos brutos publicados, cuánto inventan los modelos de lenguaje códigos y textos de la BNCC cuando responden sin acceso a la fuente estructurada, y cuánto desaparece el problema con grounding vía bncc.dev (MCP y API).
## Ronda oficial
La ronda oficial-seca-2026-08 midió 19 modelos × 900 respuestas cada uno (17.100 respuestas crudas). Se pregunta el texto exacto de una habilidad de la BNCC sin dar acceso a la fuente; la tasa de respuestas fieles al texto oficial varía del 90% al 0% según el modelo.
### Top (5 modelos)
Modelo | Nota | Texto fiel | Aceptó código falso
GPT-5.6 Sol · OpenAI | 86,4 | 90% | 25%
Claude Fable 5 · Anthropic | 80,2 | 77% | 3%
Gemini 3.1 Pro · Google | 76,0 | 61% | 4%
Claude Opus 5 · Anthropic | 75,0 | 67% | 4%
GPT-5.6 Luna · OpenAI | 73,8 | 75% | 43%
Nota es el promedio de cinco dimensiones: reconocer códigos reales, rechazar falsos, fidelidad del texto, lookup inverso y cita correcta en generación abierta.
Dos lecciones del ranking: (1) una nota alta no implica confianza — el primer puesto todavía acepta el 25% de los códigos falsos como reales; (2) acertar el texto y rechazar invenciones son habilidades distintas, por eso los puntos se dispersan. GPT-5.6 Luna y Claude Fable 5 tienen fidelidad similar (75% vs 77%), pero el primero acepta el 43% de los códigos inventados y el segundo, solo el 3%.
## Intervenciones y held-out
El estudio de intervención (8 modelos, 300 ítems, tres condiciones pareadas) mostró:
- Sin fuente: 31,9% de las respuestas con alucinación
- Dado en el prompt (sin herramienta): 0,2%
- Consultando el MCP (bncc.dev): 2,3%
Existe un conjunto held-out privado (nunca publicado) para detectar si un desempeño superior en el público deriva de memorización o de aprendizaje genuino de la BNCC.
## Qué se mide
Tarea | Pregunta típica | Mide
A · lookup directo | "¿Cuál es el texto de la habilidad EF67LP08?" | texto inventado o cambiado
B · existencia | "¿La habilidad X existe en la BNCC?" | aceptación de códigos falsos-verosímiles
C · generación abierta | "Enumera 5 habilidades de Matemática de 7º año" | códigos inventados en uso real
D · lookup inverso | "¿Cuál es el código de esta habilidad?" (dado el texto) | memorización en la dirección inversa
El gabarito es el dataset verificado de bncc.dev (@bncc/dados, 1.721 aprendizajes rastreables al documento oficial). Los códigos falsos de la tarea B se construyen a partir de las lagunas legítimas de la numeración oficial.
## Estructura del repositorio
harness/ código del benchmark (generador, runner, evaluación, agregación)
items/ banco de ítems versionado
resultados/ respuestas brutas (JSONL) y agregados, por ronda
METODOLOGIA.md protocolo completo
DECISOES.md decisiones de diseño numeradas
## Uso
pnpm install
pnpm test
pnpm gerar
pnpm executar --rodada smoke --modelos claude-haiku --limite 10
pnpm avaliar --rodada smoke
pnpm agregar --rodada smoke
pnpm agregar --rodada smoke --verificar # check usado por el CI
Ejecución local; el CI corre solo typecheck, tests y verificación de consistencia de los resultados. Las keys de los proveedores van en .env (nunca commiteadas).
## Licencias y mantenimiento
Código: MIT. Ítems, resultados y metodología: CC BY 4.0. Mantenido por Profy (https://www.profy.ai/) — existe conflicto declarado (Profy opera productos que usan LLMs sobre la BNCC), compensado por la total transparencia: metodología, ítems, respuestas crudas y juicios son públicos y recalculables, y el CI reprueba cualquier nota editada manualmente. Las rondas publicadas son inmutables.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.