Sobre o projeto

O Cantonese-LLM-Lab é um projeto de código aberto centrado no ajuste fino de grandes modelos de linguagem em cantonês, na avaliação e na adaptação ao hardware doméstico Ascend, destinado principalmente a pesquisadores e engenheiros que desejam reproduzir ou melhorar modelos de perguntas e respostas em cantonês. O projeto não depende de revisão por LLM, mas oferece um framework de avaliação objetiva e reutilizável: avaliação completa no padrão oficial do HKMMLU, tarefas oficiais de tradução mútua cantonês-mandarim, pureza do cantonês escrito, detecção de degeneração e perplexidade, além do teste exato de McNemar pareado pergunta a pergunta para todos os itens. O projeto contém seis partes principais: a primeira é o framework de avaliação mencionado acima; a segunda é o método de ablação de prompts, usando um desenho 2×2 (idioma × estrutura de formato) para verificar se o ranking é afetado pela escolha do prompt; a terceira é o portão de liberação, com teste de não inferioridade e verificação de sensibilidade δ; a quarta são as ferramentas de diagnóstico LoRA, que calculam ‖ΔW‖/‖W‖ módulo por módulo; a quinta são os scripts de reconstrução de dados SFT em cantonês de múltiplas fontes, incluindo normalização entre chinês simplificado e tradicional, deduplicação em dois níveis e segmentação antes do treinamento; a sexta são os registros de adaptação ao Ascend 910C, abrangendo a migração a partir de CUDA com apenas 4 linhas alteradas, quantização nativa W8A8, resultados negativos da otimização em modo gráfico e o problema de incompatibilidade entre mensagens de erro e causas reais. O repositório fornece scripts completos de avaliação, treinamento e implantação, incluindo várias ferramentas de avaliação e estatística em eval/, o script de construção de dados data/build_yue_sft.py, scripts de treinamento e fusão LoRA em train/, e guias de implantação CUDA e Ascend em deploy/. Os documentos de resultados registram comparações detalhadas das duas linhas de modelo 8B e 30B-A3B, ablação de prompts, ablação de dados e experimentos de quantização. Os pesos dos modelos são publicados em repositórios com acesso controlado no Hugging Face, incluindo a versão fundida em bf16, a versão quantizada dinâmica nativa W8A8 para Ascend, a versão int4, a versão de ablação treinada apenas com dados públicos e o adaptador LoRA. O código adota a licença MIT, e os conjuntos de dados usados na avaliação seguem suas respectivas licenças.