このプロジェクトについて

# bncc-benchmark BNCC(Base Nacional Comum Curricular)を対象としたLLMの幻覚公開ベンチマーク。オープンな手法・公開済み生データで、構造化ソースなしで回答する際にモデルがどれほどBNCCのコードや本文を発明するか、そしてbncc.dev(MCPおよびAPI)経由でgroundingを得た場合に問題がどれだけ解消するかを測定します。 ## 公式ラウンド ラウンド `oficial-seca-2026-08` では**19モデル×900回答**(計17,100生回答)を測定。BNCCの技能の正確なテキストを問い合わせ、ソースへのアクセスを与えずに回答させました。公式テキストに忠実な回答の比率はモデルにより90%〜0%までばらつきます。 ### トップ5モデル | モデル | 得点 | 忠実テキスト | 偽コードを承諾 | |---|---|---|---| | GPT-5.6 Sol · OpenAI | 86.4 | 90% | 25% | | Claude Fable 5 · Anthropic | 80.2 | 77% | 3% | | Gemini 3.1 Pro · Google | 76.0 | 61% | 4% | | Claude Opus 5 · Anthropic | 75.0 | 67% | 4% | | GPT-5.6 Luna · OpenAI | 73.8 | 75% | 43% | *得点*は5つの次元の平均:実コードの認識、偽コードの拒否、テキストの忠実さ、逆引きlookup、オープン生成における正しい引用。 **ランキングからの教訓:** (1) 高得点が信頼性を意味しない — トップモデルでさえ偽コードの25%を実在と受け入れている;(2) テキストを当てる能力と発明を拒否する能力は別物で、そのため得点が分散する。GPT-5.6 LunaとClaude Fable 5は忠実度が似ている(75%対77%)が、前者は発明されたコードの43%を受け入れ、後者はわずか3%。 ## 介入とheld-out 介入研究(8モデル、300項目、3条件対応)の結果: - ソースなし:**31.9%** の回答が幻覚を含む - プロンプト内に与える(ツール不使用):**0.2%** - MCP(bncc.dev)で参照:**2.3%** 公衆公開データでの優れたパフォーマンスが暗記によるものかBNCCの真の学習によるものか検出するための**プライベートheld-outセット**が存在します。 ## 測定対象 | タスク | 典型的質問 | 測定内容 | |---|---|---| | A · 直接lookup | 「EF67LP08のテキストは?」 | 発明または置換えられたテキスト | | B · 存在確認 | 「技能XはBNCCに存在するか?」 | 妥当な偽コードの承諾 | | C · オープン生成 | 「7年生の数学技能5つを示せ」 | 実際の使用における発明コード | | D · 逆引きlookup | 「この技能のコードは?」(テキスト给出) | 逆向きの暗記 | 正解はbncc.devの検証済みデータセット(`@bncc/dados`、1,721の公式文書へ追跡可能な学習単位)です。タスクBの偽コードは公式 numbering の妥当な隙間から構築されます。 ## リポジトリ構造 ``` harness/ ベンチマークコード(ジェネレーター、ランナー、評価、集計) itens/ バージョン管理された項目db resultados/ 生回答(JSONL)と集計結果(ラウンド別) METODOLOGIA.md 完全プロトコル DECISOES.md 番号付き設計決定 ``` ## 使い方 ```bash pnpm install pnpm test pnpm gerar pnpm executar --rodada smoke --modelos claude-haiku --limite 10 pnpm avaliar --rodada smoke pnpm agregar --rodada smoke pnpm agregar --rodada smoke --verificar # CIで使用するチェック ``` ローカル実行。CIはtypecheck、テスト、結果の一貫性検証のみを実行。プロバイダーキーは`.env`(コミットされない)。 ## ライセンスと運用 コード:MIT。項目・結果・手法:CC BY 4.0。[Profy](https://www.profy.ai/) が維持管理 — 競合関係の開示あり(ProfyはBNCC上のLLM製品を運営)。ただし完全な透明性で補完:手法・項目・生回答・判断はすべて公開・再計算可能、CIは手動編集された得点を一切通過させない。公開済みラウンドは不変。