Sobre el proyecto

Cantonese-LLM-Lab es un proyecto de código abierto centrado en el ajuste fino, la evaluación y la adaptación a hardware nacional Ascend de modelos grandes de lenguaje en cantonés, dirigido principalmente a investigadores e ingenieros que deseen reproducir o mejorar modelos de preguntas y respuestas en cantonés. El proyecto no depende de la revisión por LLM, sino que ofrece un marco de evaluación objetivo y reutilizable: evaluación completa según el estándar oficial de HKMMLU, tareas oficiales de traducción mutua cantonés-mandarín, pureza del cantonés escrito, detección de degeneración y perplejidad, además de aplicar la prueba exacta de McNemar con emparejamiento pregunta por pregunta a todos los ítems. El proyecto consta de seis partes principales: la primera es el marco de evaluación mencionado; la segunda es el método de ablación de prompts, que utiliza un diseño 2×2 (idioma × andamiaje de formato) para comprobar si la clasificación se ve afectada por la elección del prompt; la tercera es la puerta de publicación, que emplea pruebas de no inferioridad y comprobaciones de sensibilidad δ; la cuarta es la herramienta de diagnóstico LoRA, que calcula ‖ΔW‖/‖W‖ módulo por módulo; la quinta son los scripts de reconstrucción de datos SFT en cantonés de múltiples fuentes, que incluyen normalización entre chino simplificado y tradicional, deduplicación en dos niveles y segmentación previa al entrenamiento; y la sexta son los registros de adaptación a Ascend 910C, que abarcan la migración desde CUDA con solo 4 líneas modificadas, la cuantización nativa W8A8, los resultados negativos de la optimización en modo gráfico y el problema de desajuste entre los mensajes de error y las causas raíz reales. El repositorio proporciona scripts completos de evaluación, entrenamiento y despliegue, incluyendo múltiples herramientas de evaluación y estadística bajo eval/, el script de construcción de datos data/build_yue_sft.py, los scripts de entrenamiento y fusión LoRA bajo train/, y las guías de despliegue CUDA y Ascend bajo deploy/. Los documentos de resultados registran comparaciones detalladas de dos líneas de modelos, 8B y 30B-A3B, así como experimentos de ablación de prompts, ablación de datos y cuantización. Los pesos de los modelos se publican en repositorios con control de acceso en Hugging Face, e incluyen la versión fusionada en bf16, la versión de cuantización dinámica nativa W8A8 de Ascend, la versión int4, la versión de ablación entrenada únicamente con datos públicos y el adaptador LoRA. El código está bajo licencia MIT, y los conjuntos de datos utilizados en la evaluación siguen sus respectivas licencias.