Об этом проекте
bncc-benchmark
Публичный бенчмарк галлюцинаций LLM по BNCC (Base Nacional Comum Curricular). С открытой методологией и опубликованными сырыми данными он измеряет, насколько языковые модели выдумывают коды и тексты BNCC, отвечая без доступа к структурированному источнику, и насколько эта проблема исчезает при grounding через bncc.dev (MCP и API).
Официальный раунд
Раунд oficial-seca-2026-08 измерил 19 моделей × 900 ответов каждая (17 100 сырых ответов). Модель просят воспроизвести точный текст навыка BNCC, не давая доступа к источнику; доля ответов, верных официальному тексту, варьируется от 90% до 0% в зависимости от модели.
Топ (5 моделей)
| Модель | Нота | Точный текст | Принял ложный код |
|---|---|---|---|
| GPT-5.6 Sol · OpenAI | 86,4 | 90% | 25% |
| Claude Fable 5 · Anthropic | 80,2 | 77% | 3% |
| Gemini 3.1 Pro · Google | 76,0 | 61% | 4% |
| Claude Opus 5 · Anthropic | 75,0 | 67% | 4% |
| GPT-5.6 Luna · OpenAI | 73,8 | 75% | 43% |
Нота — среднее по пяти измерениям: распознавание реальных кодов, отказ от ложных, точность текста, обратный поиск и корректное цитирование при открытой генерации.
Два урока рейтинга: (1) высокая нота не означает доверия — лидер всё ещё принимает 25% ложных кодов за реальные; (2) воспроизвести текст и отказаться от выдумок — разные навыки, поэтому баллы расходятся. У GPT-5.6 Luna и Claude Fable 5 схожая точность (75% против 77%), но первый принимает 43% выдуманных кодов, а второй — лишь 3%.
Вмешательства и held-out
Исследование вмешательства (8 моделей, 300 пунктов, три парных условия) показало:
- Без источника: 31,9% ответов с галлюцинацией
- Данные в промпте (без инструмента): 0,2%
- С обращением к MCP (bncc.dev): 2,3%
Существует приватный held-out набор (никогда не публиковавшийся), чтобы выявлять, обусловлено ли более высокое качество на публичном наборе запоминанием или подлинным усвоением BNCC.
Что измеряется
| Задача | Типичный вопрос | Что измеряет |
|---|---|---|
| A · прямой поиск | «Каков текст навыка EF67LP08?» | выдуманный или подменённый текст |
| B · существование | «Существует ли навык X в BNCC?» | принятие правдоподобных ложных кодов |
| C · открытая генерация | «Перечислите 5 навыков по математике для 7 класса» | выдуманные коды в реальном использовании |
| D · обратный поиск | «Каков код этого навыка?» (дан текст) | запоминание в обратном направлении |
Эталон — проверенный датасет bncc.dev (@bncc/dados, 1721 учебный результат, прослеживаемый до официального документа). Ложные коды для задачи B строятся из легитимных пробелов в официальной нумерации.
Структура репозитория
harness/ — код бенчмарка (генератор, раннер, оценка, агрегация)
itens/ — версионируемый банк пунктов
resultados/ — сырые ответы (JSONL) и агрегаты, по раундам
METODOLOGIA.md — полный протокол
DECISOES.md — пронумерованные проектные решения
Использование
pnpm install
pnpm test
pnpm gerar
pnpm executar --rodada smoke --modelos claude-haiku --limite 10
pnpm avaliar --rodada smoke
pnpm agregar --rodada smoke
pnpm agregar --rodada smoke --verificar (проверка, используемая CI)
Запуск локальный; CI прогоняет только typecheck, тесты и проверку согласованности результатов. Ключи провайдеров в .env (никогда не коммитятся).
Лицензии и сопровождение
Код: MIT. Пункты, результаты и методология: CC BY 4.0. Поддерживается Profy (https://www.profy.ai/) — заявленный конфликт интересов (Profy управляет продуктами, использующими LLM по BNCC) компенсируется полной прозрачностью: методология, пункты, сырые ответы и оценки публичны и пересчитываемы, а CI отклоняет любую вручную отредактированную ноту. Опубликованные раунды неизменяемы.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.