このプロジェクトについて
# bncc-benchmark
BNCC(Base Nacional Comum Curricular)を対象としたLLMの幻覚公開ベンチマーク。オープンな手法・公開済み生データで、構造化ソースなしで回答する際にモデルがどれほどBNCCのコードや本文を発明するか、そしてbncc.dev(MCPおよびAPI)経由でgroundingを得た場合に問題がどれだけ解消するかを測定します。
## 公式ラウンド
ラウンド `oficial-seca-2026-08` では**19モデル×900回答**(計17,100生回答)を測定。BNCCの技能の正確なテキストを問い合わせ、ソースへのアクセスを与えずに回答させました。公式テキストに忠実な回答の比率はモデルにより90%〜0%までばらつきます。
### トップ5モデル
| モデル | 得点 | 忠実テキスト | 偽コードを承諾 |
|---|---|---|---|
| GPT-5.6 Sol · OpenAI | 86.4 | 90% | 25% |
| Claude Fable 5 · Anthropic | 80.2 | 77% | 3% |
| Gemini 3.1 Pro · Google | 76.0 | 61% | 4% |
| Claude Opus 5 · Anthropic | 75.0 | 67% | 4% |
| GPT-5.6 Luna · OpenAI | 73.8 | 75% | 43% |
*得点*は5つの次元の平均:実コードの認識、偽コードの拒否、テキストの忠実さ、逆引きlookup、オープン生成における正しい引用。
**ランキングからの教訓:** (1) 高得点が信頼性を意味しない — トップモデルでさえ偽コードの25%を実在と受け入れている;(2) テキストを当てる能力と発明を拒否する能力は別物で、そのため得点が分散する。GPT-5.6 LunaとClaude Fable 5は忠実度が似ている(75%対77%)が、前者は発明されたコードの43%を受け入れ、後者はわずか3%。
## 介入とheld-out
介入研究(8モデル、300項目、3条件対応)の結果:
- ソースなし:**31.9%** の回答が幻覚を含む
- プロンプト内に与える(ツール不使用):**0.2%**
- MCP(bncc.dev)で参照:**2.3%**
公衆公開データでの優れたパフォーマンスが暗記によるものかBNCCの真の学習によるものか検出するための**プライベートheld-outセット**が存在します。
## 測定対象
| タスク | 典型的質問 | 測定内容 |
|---|---|---|
| A · 直接lookup | 「EF67LP08のテキストは?」 | 発明または置換えられたテキスト |
| B · 存在確認 | 「技能XはBNCCに存在するか?」 | 妥当な偽コードの承諾 |
| C · オープン生成 | 「7年生の数学技能5つを示せ」 | 実際の使用における発明コード |
| D · 逆引きlookup | 「この技能のコードは?」(テキスト给出) | 逆向きの暗記 |
正解はbncc.devの検証済みデータセット(`@bncc/dados`、1,721の公式文書へ追跡可能な学習単位)です。タスクBの偽コードは公式 numbering の妥当な隙間から構築されます。
## リポジトリ構造
```
harness/ ベンチマークコード(ジェネレーター、ランナー、評価、集計)
itens/ バージョン管理された項目db
resultados/ 生回答(JSONL)と集計結果(ラウンド別)
METODOLOGIA.md 完全プロトコル
DECISOES.md 番号付き設計決定
```
## 使い方
```bash
pnpm install
pnpm test
pnpm gerar
pnpm executar --rodada smoke --modelos claude-haiku --limite 10
pnpm avaliar --rodada smoke
pnpm agregar --rodada smoke
pnpm agregar --rodada smoke --verificar # CIで使用するチェック
```
ローカル実行。CIはtypecheck、テスト、結果の一貫性検証のみを実行。プロバイダーキーは`.env`(コミットされない)。
## ライセンスと運用
コード:MIT。項目・結果・手法:CC BY 4.0。[Profy](https://www.profy.ai/) が維持管理 — 競合関係の開示あり(ProfyはBNCC上のLLM製品を運営)。ただし完全な透明性で補完:手法・項目・生回答・判断はすべて公開・再計算可能、CIは手動編集された得点を一切通過させない。公開済みラウンドは不変。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.