Об этом проекте

bncc-benchmark Публичный бенчмарк галлюцинаций LLM по BNCC (Base Nacional Comum Curricular). С открытой методологией и опубликованными сырыми данными он измеряет, насколько языковые модели выдумывают коды и тексты BNCC, отвечая без доступа к структурированному источнику, и насколько эта проблема исчезает при grounding через bncc.dev (MCP и API). Официальный раунд Раунд oficial-seca-2026-08 измерил 19 моделей × 900 ответов каждая (17 100 сырых ответов). Модель просят воспроизвести точный текст навыка BNCC, не давая доступа к источнику; доля ответов, верных официальному тексту, варьируется от 90% до 0% в зависимости от модели. Топ (5 моделей) | Модель | Нота | Точный текст | Принял ложный код | |---|---|---|---| | GPT-5.6 Sol · OpenAI | 86,4 | 90% | 25% | | Claude Fable 5 · Anthropic | 80,2 | 77% | 3% | | Gemini 3.1 Pro · Google | 76,0 | 61% | 4% | | Claude Opus 5 · Anthropic | 75,0 | 67% | 4% | | GPT-5.6 Luna · OpenAI | 73,8 | 75% | 43% | Нота — среднее по пяти измерениям: распознавание реальных кодов, отказ от ложных, точность текста, обратный поиск и корректное цитирование при открытой генерации. Два урока рейтинга: (1) высокая нота не означает доверия — лидер всё ещё принимает 25% ложных кодов за реальные; (2) воспроизвести текст и отказаться от выдумок — разные навыки, поэтому баллы расходятся. У GPT-5.6 Luna и Claude Fable 5 схожая точность (75% против 77%), но первый принимает 43% выдуманных кодов, а второй — лишь 3%. Вмешательства и held-out Исследование вмешательства (8 моделей, 300 пунктов, три парных условия) показало: - Без источника: 31,9% ответов с галлюцинацией - Данные в промпте (без инструмента): 0,2% - С обращением к MCP (bncc.dev): 2,3% Существует приватный held-out набор (никогда не публиковавшийся), чтобы выявлять, обусловлено ли более высокое качество на публичном наборе запоминанием или подлинным усвоением BNCC. Что измеряется | Задача | Типичный вопрос | Что измеряет | |---|---|---| | A · прямой поиск | «Каков текст навыка EF67LP08?» | выдуманный или подменённый текст | | B · существование | «Существует ли навык X в BNCC?» | принятие правдоподобных ложных кодов | | C · открытая генерация | «Перечислите 5 навыков по математике для 7 класса» | выдуманные коды в реальном использовании | | D · обратный поиск | «Каков код этого навыка?» (дан текст) | запоминание в обратном направлении | Эталон — проверенный датасет bncc.dev (@bncc/dados, 1721 учебный результат, прослеживаемый до официального документа). Ложные коды для задачи B строятся из легитимных пробелов в официальной нумерации. Структура репозитория harness/ — код бенчмарка (генератор, раннер, оценка, агрегация) itens/ — версионируемый банк пунктов resultados/ — сырые ответы (JSONL) и агрегаты, по раундам METODOLOGIA.md — полный протокол DECISOES.md — пронумерованные проектные решения Использование pnpm install pnpm test pnpm gerar pnpm executar --rodada smoke --modelos claude-haiku --limite 10 pnpm avaliar --rodada smoke pnpm agregar --rodada smoke pnpm agregar --rodada smoke --verificar (проверка, используемая CI) Запуск локальный; CI прогоняет только typecheck, тесты и проверку согласованности результатов. Ключи провайдеров в .env (никогда не коммитятся). Лицензии и сопровождение Код: MIT. Пункты, результаты и методология: CC BY 4.0. Поддерживается Profy (https://www.profy.ai/) — заявленный конфликт интересов (Profy управляет продуктами, использующими LLM по BNCC) компенсируется полной прозрачностью: методология, пункты, сырые ответы и оценки публичны и пересчитываемы, а CI отклоняет любую вручную отредактированную ноту. Опубликованные раунды неизменяемы.