프로젝트 소개

Cantonese-LLM-Lab은 광둥어 대형 모델 파인튜닝, 평가 및 국산 Ascend 하드웨어 적응을 중심으로 한 오픈소스 프로젝트로, 광둥어 질의응답 모델을 재현하거나 개선하려는 연구자와 엔지니어를 대상으로 합니다. 이 프로젝트는 LLM 평가에 의존하지 않고 재사용 가능한 객관적 평가 프레임워크를 제공합니다: HKMMLU 공식 기준 전체 평가, 공식 광둥어-표준중국어 상호 번역 과제, 문어 광둥어 순수도, 퇴화 감지 및 혼란도, 그리고 모든 문항에 대한 문항별 쌍 비교 McNemar 정확 검정. 프로젝트는 여섯 가지 주요 부분으로 구성됩니다: 첫째, 위에서 언급한 평가 프레임워크; 둘째, 프롬프트 소거 방법으로, 2×2(언어 × 형식 스캐폴드)를 사용하여 순위가 프롬프트 선택의 영향을 받는지 검정합니다; 셋째, 릴리스 게이트로, 비열등성 검정과 δ 민감도 검사를 채택합니다; 넷째, LoRA 진단 도구로, 모듈별로 ‖ΔW‖/‖W‖를 계산합니다; 다섯째, 다중 소스 광둥어 SFT 데이터 재구축 스크립트로, 간체-번체 정규화, 2단계 중복 제거 및 선분할 후훈련을 포함합니다; 여섯째, Ascend 910C 적응 기록으로, CUDA에서 마이그레이션 시 4줄만 수정하면 되는 점, 네이티브 W8A8 양자화, 그래프 모드 최적화의 부정적 결과, 그리고 오류 메시지와 실제 근본 원인이 일치하지 않는 문제를 다룹니다. 저장소는 완전한 평가, 훈련 및 배포 스크립트를 제공하며, eval/ 아래의 여러 평가 및 통계 도구, data/build_yue_sft.py 데이터 구축 스크립트, train/ 아래의 LoRA 훈련 및 병합 스크립트, 그리고 deploy/ 아래의 CUDA 및 Ascend 배포 가이드를 포함합니다. 결과 문서에는 8B와 30B-A3B 두 모델 라인의 상세 비교, 프롬프트 소거, 데이터 소거 및 양자화 실험이 기록되어 있습니다. 모델 가중치는 Hugging Face의 게이트 저장소에 공개되어 있으며, bf16 병합 버전, Ascend 네이티브 W8A8 동적 양자화 버전, int4 버전, 공개 데이터만으로 훈련한 소거 버전 및 LoRA 어댑터를 포함합니다. 코드는 MIT 라이선스를 채택하며, 평가에 사용된 데이터셋은 각각의 라이선스를 따릅니다.