这个项目能做什么
Cantonese-LLM-Lab 是一个围绕粤语大模型微调、评测和国产昇腾硬件适配的开源项目,主要面向希望复现或改进粤语问答模型的研究者与工程师。项目不依赖 LLM 评审,而是提供一套可复用的客观评测框架:HKMMLU 官方口径全量评测、官方粤普互译任务、书面粤语纯度、退化检测和困惑度,并对所有题目做逐题配对的 McNemar 精确检验。
项目包含六个主要部分:一是上述评测框架;二是提示词消融方法,用 2×2(语言 × 格式脚手架)检验排名是否受提示词选择影响;三是发布闸门,采用非劣效检验和 δ 敏感性检查;四是 LoRA 诊断工具,逐模块计算 ‖ΔW‖/‖W‖;五是多源粤语 SFT 数据重建脚本,包含简繁归一、两级去重和先切分后训练;六是昇腾 910C 适配记录,涵盖从 CUDA 迁移只需改 4 行、原生 W8A8 量化、图模式优化的负结果,以及错误信息与实际根因不匹配的问题。
仓库提供完整的评测、训练和部署脚本,包括 eval/ 下的多个评测与统计工具、data/build_yue_sft.py 数据构建脚本、train/ 下的 LoRA 训练与合并脚本,以及 deploy/ 下的 CUDA 和昇腾部署指引。结果文档记录了 8B 和 30B-A3B 两条模型线的详细对比、提示词消融、数据消融和量化实验。
模型权重发布在 Hugging Face 的门禁仓库中,包含 bf16 合并版、昇腾原生 W8A8 动态量化版、int4 版、仅用公开数据训练的消融版和 LoRA adapter。代码采用 MIT 许可,评测所用数据集遵循各自许可。
评论
0 评分人数达到10人后显示
登录后参与讨论。