À propos du projet

Cantonese-LLM-Lab est un projet open source centré sur le fine-tuning de grands modèles de langue cantonais, l'évaluation et l'adaptation au matériel national Ascend, destiné principalement aux chercheurs et ingénieurs souhaitant reproduire ou améliorer des modèles de questions-réponses en cantonais. Le projet ne dépend pas d'une évaluation par LLM, mais fournit un cadre d'évaluation objectif et réutilisable : évaluation complète selon le protocole officiel HKMMLU, tâches officielles de traduction mutuelle cantonais-mandarin, pureté du cantonais écrit, détection de dégénérescence et perplexité, avec un test exact de McNemar apparié question par question sur l'ensemble des items. Le projet comprend six parties principales : premièrement, le cadre d'évaluation mentionné ci-dessus ; deuxièmement, une méthode d'ablation des prompts, utilisant un plan 2×2 (langue × gabarit de format) pour vérifier si le classement est influencé par le choix des prompts ; troisièmement, une porte de publication, avec test de non-infériorité et contrôle de sensibilité δ ; quatrièmement, un outil de diagnostic LoRA, calculant ‖ΔW‖/‖W‖ module par module ; cinquièmement, un script de reconstruction de données SFT cantonaises multi-sources, incluant la normalisation simplifié-traditionnel, la déduplication à deux niveaux et le découpage avant entraînement ; sixièmement, des notes d'adaptation sur Ascend 910C, couvrant la migration depuis CUDA ne nécessitant que 4 lignes modifiées, la quantification native W8A8, les résultats négatifs de l'optimisation en mode graphe, ainsi que les problèmes de non-correspondance entre les messages d'erreur et les causes réelles. Le dépôt fournit des scripts complets d'évaluation, d'entraînement et de déploiement, incluant plusieurs outils d'évaluation et de statistiques sous eval/, le script de construction de données data/build_yue_sft.py, les scripts d'entraînement et de fusion LoRA sous train/, ainsi que des guides de déploiement CUDA et Ascend sous deploy/. Les documents de résultats enregistrent la comparaison détaillée de deux lignes de modèles, 8B et 30B-A3B, les ablations de prompts, les ablations de données et les expériences de quantification. Les poids des modèles sont publiés dans un dépôt à accès contrôlé sur Hugging Face, incluant la version fusionnée bf16, la version quantifiée dynamique native Ascend W8A8, la version int4, la version d'ablation entraînée uniquement sur des données publiques et l'adaptateur LoRA. Le code est sous licence MIT, et les jeux de données utilisés pour l'évaluation suivent leurs licences respectives.