Sobre el proyecto

# bncc-benchmark Benchmark público de alucinación de LLMs sobre la BNCC (Base Nacional Comum Curricular). Mide, con metodología abierta y datos brutos publicados, cuánto inventan los modelos de lenguaje códigos y textos de la BNCC cuando responden sin acceso a la fuente estructurada, y cuánto desaparece el problema con grounding vía bncc.dev (MCP y API). ## Ronda oficial La ronda oficial-seca-2026-08 midió 19 modelos × 900 respuestas cada uno (17.100 respuestas crudas). Se pregunta el texto exacto de una habilidad de la BNCC sin dar acceso a la fuente; la tasa de respuestas fieles al texto oficial varía del 90% al 0% según el modelo. ### Top (5 modelos) Modelo | Nota | Texto fiel | Aceptó código falso GPT-5.6 Sol · OpenAI | 86,4 | 90% | 25% Claude Fable 5 · Anthropic | 80,2 | 77% | 3% Gemini 3.1 Pro · Google | 76,0 | 61% | 4% Claude Opus 5 · Anthropic | 75,0 | 67% | 4% GPT-5.6 Luna · OpenAI | 73,8 | 75% | 43% Nota es el promedio de cinco dimensiones: reconocer códigos reales, rechazar falsos, fidelidad del texto, lookup inverso y cita correcta en generación abierta. Dos lecciones del ranking: (1) una nota alta no implica confianza — el primer puesto todavía acepta el 25% de los códigos falsos como reales; (2) acertar el texto y rechazar invenciones son habilidades distintas, por eso los puntos se dispersan. GPT-5.6 Luna y Claude Fable 5 tienen fidelidad similar (75% vs 77%), pero el primero acepta el 43% de los códigos inventados y el segundo, solo el 3%. ## Intervenciones y held-out El estudio de intervención (8 modelos, 300 ítems, tres condiciones pareadas) mostró: - Sin fuente: 31,9% de las respuestas con alucinación - Dado en el prompt (sin herramienta): 0,2% - Consultando el MCP (bncc.dev): 2,3% Existe un conjunto held-out privado (nunca publicado) para detectar si un desempeño superior en el público deriva de memorización o de aprendizaje genuino de la BNCC. ## Qué se mide Tarea | Pregunta típica | Mide A · lookup directo | "¿Cuál es el texto de la habilidad EF67LP08?" | texto inventado o cambiado B · existencia | "¿La habilidad X existe en la BNCC?" | aceptación de códigos falsos-verosímiles C · generación abierta | "Enumera 5 habilidades de Matemática de 7º año" | códigos inventados en uso real D · lookup inverso | "¿Cuál es el código de esta habilidad?" (dado el texto) | memorización en la dirección inversa El gabarito es el dataset verificado de bncc.dev (@bncc/dados, 1.721 aprendizajes rastreables al documento oficial). Los códigos falsos de la tarea B se construyen a partir de las lagunas legítimas de la numeración oficial. ## Estructura del repositorio harness/ código del benchmark (generador, runner, evaluación, agregación) items/ banco de ítems versionado resultados/ respuestas brutas (JSONL) y agregados, por ronda METODOLOGIA.md protocolo completo DECISOES.md decisiones de diseño numeradas ## Uso pnpm install pnpm test pnpm gerar pnpm executar --rodada smoke --modelos claude-haiku --limite 10 pnpm avaliar --rodada smoke pnpm agregar --rodada smoke pnpm agregar --rodada smoke --verificar # check usado por el CI Ejecución local; el CI corre solo typecheck, tests y verificación de consistencia de los resultados. Las keys de los proveedores van en .env (nunca commiteadas). ## Licencias y mantenimiento Código: MIT. Ítems, resultados y metodología: CC BY 4.0. Mantenido por Profy (https://www.profy.ai/) — existe conflicto declarado (Profy opera productos que usan LLMs sobre la BNCC), compensado por la total transparencia: metodología, ítems, respuestas crudas y juicios son públicos y recalculables, y el CI reprueba cualquier nota editada manualmente. Las rondas publicadas son inmutables.