프로젝트 소개
# bncc-benchmark
BNCC(브라질 국가 공통 교육 과정 기준)에 대한 LLM 알루시네이션 공개 벤치마크. 개방된 방법론과 공개 원본 데이터로, 구조화된 소스에 접근 없이 응답할 때 언어 모델이 BNCC의 코드와 텍스트를 얼마나虚构하는지, 그리고 bncc.dev(MCP 및 API)를 통한 grounding을 사용할 때 문제가 얼마나 사라지는지 측정한다.
## 공식 라운드
`oficial-seca-2026-08` 라운드는 **19개 모델 × 각 900회 응답**(17,100회 원본 응답)을 측정했다. BNCC 능력의 정확한 텍스트를getSource 없이 질문하며, 공식 텍스트에 대한 정확 응답률은 모델별로 90%에서 0%까지 다양하다.
### 상위 5개 모델
| 모델 | 점수 | 본문 정확 | 잘못된 코드 수용 |
|---|---|---|---|
| GPT-5.6 Sol · OpenAI | 86,4 | 90% | 25% |
| Claude Fable 5 · Anthropic | 80,2 | 77% | 3% |
| Gemini 3.1 Pro · Google | 76,0 | 61% | 4% |
| Claude Opus 5 · Anthropic | 75,0 | 67% | 4% |
| GPT-5.6 Luna · OpenAI | 73,8 | 75% | 43% |
*점수*는 5차원 평균: 실제 코드 인식, 잘못된 코드 거부, 본문 충실도, 역순 lookup, 개방형 생성에서 올바른 인용이다.
**랭킹에서 두 가지 교훈:** (1) 높은 점수가 신뢰성을 의미하지 않음 — 1위는 여전히 잘못된 코드의 25%를 실제대로 수용함; (2) 본문 정확과 발명 거부 별개의 능력이라 점수가 분산됨. GPT-5.6 Luna와 Claude Fable 5는 유사한 충실도(75% vs 77%)이나, 전자는虚构된 코드의 43%를 수용하고 후자는 단 3%만 수용함.
## 중재와 held-out
중재 연구(8개 모델, 300항목, 쌍지정 3조건) 결과:
- Source 없음: **응답의 31,9%**가 알루시네이션
- 프롬프트 제공(Source 없음 도구): **0,2%**
- MCP(bncc.dev) 조회: **2,3%**
상위 성능이 기억인지 학습인지 감지하기 위한 **비공개 held-out 세트**(미공개) 존재.
## 측정 항목
| 작업 | 전형적 질문 | 측정 |
|---|---|---|
| A · 직역 lookup | "EF67LP08 능력의 본문은?" | 虚构 또는 교체된 본문 |
| B · 존재 여부 | "능력 X가 BNCC에 존재?" | 합리적인 잘못된 코드 수용 |
| C · 개방형 생성 | "7학년 수학 능력 5개 나열" | 실제 사용中的 虚构 코드 |
| D · 역순 lookup | "이 능력의 코드는?" (본문 주어짐) | 역방향 암기 |
정답은 bncc.dev의 검증 데이터셋(`@bncc/dados`, 공식 문서 1,721개 추적 가능 학습) 기준. 작업 B의 잘못된 코드는 공식 번호 매기기 gap 기반 구축.
## 리포지터리 구조
```
harness/ 벤치마크 코드(생성기, 실행기, 평가, 집계)
itens/ 버전 관리된 항목 풀
resultados/ 라운드별 원본 응답(JSONL) 및 집계값
METODOLOGIA.md 완전 프로토콜
DECISOES.md 번호 지정 설계 결정
```
## 사용법
```bash
pnpm install
pnpm test
pnpm gerar
pnpm executar --rodada smoke --modelos claude-haiku --limite 10
pnpm avaliar --rodada smoke
pnpm agregar --rodada smoke
pnpm agregar --rodada smoke --verificar # CI에서 사용하는 검증
```
로컬 실행; CI는 typecheck, 테스트, 결과 일관성 검증만 실행. 제공자 키는 `.env`(커밋되지 않음).
## 라이선스와 유지보수
코드: MIT. 항목, 결과, 방법론: CC BY 4.0. [Profy](https://www.profy.ai/) 운영 — 충돌 선언 있음(Profy는 BNCC 기반 LLM 제품 운영), 완전 투명성으로 상쇄: 방법론, 항목, 원본 응답, 평가 모두 공개 및 재계산 가능, CI는 수동 수정 점수를 거부. 공개된 라운드는 변경 불가.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.