프로젝트 소개

# bncc-benchmark BNCC(브라질 국가 공통 교육 과정 기준)에 대한 LLM 알루시네이션 공개 벤치마크. 개방된 방법론과 공개 원본 데이터로, 구조화된 소스에 접근 없이 응답할 때 언어 모델이 BNCC의 코드와 텍스트를 얼마나虚构하는지, 그리고 bncc.dev(MCP 및 API)를 통한 grounding을 사용할 때 문제가 얼마나 사라지는지 측정한다. ## 공식 라운드 `oficial-seca-2026-08` 라운드는 **19개 모델 × 각 900회 응답**(17,100회 원본 응답)을 측정했다. BNCC 능력의 정확한 텍스트를getSource 없이 질문하며, 공식 텍스트에 대한 정확 응답률은 모델별로 90%에서 0%까지 다양하다. ### 상위 5개 모델 | 모델 | 점수 | 본문 정확 | 잘못된 코드 수용 | |---|---|---|---| | GPT-5.6 Sol · OpenAI | 86,4 | 90% | 25% | | Claude Fable 5 · Anthropic | 80,2 | 77% | 3% | | Gemini 3.1 Pro · Google | 76,0 | 61% | 4% | | Claude Opus 5 · Anthropic | 75,0 | 67% | 4% | | GPT-5.6 Luna · OpenAI | 73,8 | 75% | 43% | *점수*는 5차원 평균: 실제 코드 인식, 잘못된 코드 거부, 본문 충실도, 역순 lookup, 개방형 생성에서 올바른 인용이다. **랭킹에서 두 가지 교훈:** (1) 높은 점수가 신뢰성을 의미하지 않음 — 1위는 여전히 잘못된 코드의 25%를 실제대로 수용함; (2) 본문 정확과 발명 거부 별개의 능력이라 점수가 분산됨. GPT-5.6 Luna와 Claude Fable 5는 유사한 충실도(75% vs 77%)이나, 전자는虚构된 코드의 43%를 수용하고 후자는 단 3%만 수용함. ## 중재와 held-out 중재 연구(8개 모델, 300항목, 쌍지정 3조건) 결과: - Source 없음: **응답의 31,9%**가 알루시네이션 - 프롬프트 제공(Source 없음 도구): **0,2%** - MCP(bncc.dev) 조회: **2,3%** 상위 성능이 기억인지 학습인지 감지하기 위한 **비공개 held-out 세트**(미공개) 존재. ## 측정 항목 | 작업 | 전형적 질문 | 측정 | |---|---|---| | A · 직역 lookup | "EF67LP08 능력의 본문은?" | 虚构 또는 교체된 본문 | | B · 존재 여부 | "능력 X가 BNCC에 존재?" | 합리적인 잘못된 코드 수용 | | C · 개방형 생성 | "7학년 수학 능력 5개 나열" | 실제 사용中的 虚构 코드 | | D · 역순 lookup | "이 능력의 코드는?" (본문 주어짐) | 역방향 암기 | 정답은 bncc.dev의 검증 데이터셋(`@bncc/dados`, 공식 문서 1,721개 추적 가능 학습) 기준. 작업 B의 잘못된 코드는 공식 번호 매기기 gap 기반 구축. ## 리포지터리 구조 ``` harness/ 벤치마크 코드(생성기, 실행기, 평가, 집계) itens/ 버전 관리된 항목 풀 resultados/ 라운드별 원본 응답(JSONL) 및 집계값 METODOLOGIA.md 완전 프로토콜 DECISOES.md 번호 지정 설계 결정 ``` ## 사용법 ```bash pnpm install pnpm test pnpm gerar pnpm executar --rodada smoke --modelos claude-haiku --limite 10 pnpm avaliar --rodada smoke pnpm agregar --rodada smoke pnpm agregar --rodada smoke --verificar # CI에서 사용하는 검증 ``` 로컬 실행; CI는 typecheck, 테스트, 결과 일관성 검증만 실행. 제공자 키는 `.env`(커밋되지 않음). ## 라이선스와 유지보수 코드: MIT. 항목, 결과, 방법론: CC BY 4.0. [Profy](https://www.profy.ai/) 운영 — 충돌 선언 있음(Profy는 BNCC 기반 LLM 제품 운영), 완전 투명성으로 상쇄: 방법론, 항목, 원본 응답, 평가 모두 공개 및 재계산 가능, CI는 수동 수정 점수를 거부. 공개된 라운드는 변경 불가.