عن المشروع

Cantonese-LLM-Lab هو مشروع مفتوح المصدر يركز على ضبط النماذج اللغوية الكبيرة بالكانتونية وتقييمها وتكييفها مع العتاد الصيني Ascend، ويستهدف الباحثين والمهندسين الراغبين في إعادة إنتاج أو تحسين نماذج الأسئلة والأجوبة الكانتونية. لا يعتمد المشروع على مراجعة LLM، بل يوفر إطار تقييم موضوعيًا قابلًا لإعادة الاستخدام: تقييم كامل وفق المعيار الرسمي HKMMLU، ومهام الترجمة الرسمية بين الكانتونية والمندرينية، ونقاء الكانتونية المكتوبة، وكشف التدهور، والارتباك، مع إجراء اختبار McNemar الدقيق لكل سؤال على حدة بطريقة الاقتران. يتضمن المشروع ستة أجزاء رئيسية: الأول هو إطار التقييم المذكور أعلاه؛ والثاني هو طريقة استئصال المطالبات، باستخدام 2×2 (اللغة × هيكل الصياغة) لاختبار ما إذا كان الترتيب يتأثر باختيار المطالبات؛ والثالث هو بوابة الإصدار، باستخدام اختبار عدم الدونية وفحص حساسية δ؛ والرابع هو أداة تشخيص LoRA، بحساب ‖ΔW‖/‖W‖ لكل وحدة على حدة؛ والخامس هو سكربت إعادة بناء بيانات SFT الكانتونية متعددة المصادر، بما في ذلك توحيد الصينية المبسطة والتقليدية، وإزالة التكرار على مستويين، والتقسيم قبل التدريب؛ والسادس هو سجلات التكييف مع Ascend 910C، وتشمل الهجرة من CUDA بتعديل 4 أسطر فقط، والتكميم الأصلي W8A8، والنتائج السلبية لتحسين وضع الرسم البياني، ومشكلة عدم تطابق رسائل الخطأ مع السبب الجذري الفعلي. يوفر المستودع سكربتات كاملة للتقييم والتدريب والنشر، بما في ذلك أدوات تقييم وإحصاء متعددة تحت eval/، وسكربت بناء البيانات data/build_yue_sft.py، وسكربتات تدريب ودمج LoRA تحت train/، وإرشادات النشر لـ CUDA وAscend تحت deploy/. توثق مستندات النتائج مقارنات تفصيلية لخطي النموذجين 8B و30B-A3B، واستئصال المطالبات، واستئصال البيانات، وتجارب التكميم. تُنشر أوزان النماذج في مستودعات مقيدة على Hugging Face، وتشمل نسخة مدمجة bf16، ونسخة تكميم ديناميكي أصلي W8A8 لـ Ascend، ونسخة int4، ونسخة استئصالية مدربة على البيانات العامة فقط، ومحولات LoRA. الكود مرخص بموجب MIT، وتخضع مجموعات البيانات المستخدمة في التقييم لتراخيصها الخاصة.