このプロジェクトについて

Cantonese-LLM-Labは、広東語大規模言語モデルの微調整、評価、国産Ascendハードウェア対応を中心としたオープンソースプロジェクトで、広東語質問応答モデルの再現や改善を目指す研究者・エンジニア向けです。プロジェクトはLLM審査に依存せず、再利用可能な客観的評価フレームワークを提供します。HKMMLU公式基準による全量評価、公式広東語-普通話相互翻訳タスク、書き言葉広東語の純度、劣化検出、困惑度に加え、全問題に対して問題ごとに対応付けたMcNemar正確検定を実施します。 プロジェクトは6つの主要部分で構成されます。1つ目は上記の評価フレームワーク、2つ目はプロンプトアブレーション手法で、2×2(言語×形式スキャフォールド)によりランキングがプロンプト選択に影響されるかを検証します。3つ目はリリースゲートで、非劣性検定とδ感度チェックを採用します。4つ目はLoRA診断ツールで、モジュールごとに‖ΔW‖/‖W‖を計算します。5つ目はマルチソース広東語SFTデータ再構築スクリプトで、簡体字・繁体字の正規化、2段階の重複排除、先に分割してから学習する方式を含みます。6つ目はAscend 910C対応記録で、CUDAからの移行がわずか4行の変更で済むこと、ネイティブW8A8量子化、グラフモード最適化の否定的結果、エラーメッセージと実際の根本原因が一致しない問題を網羅します。 リポジトリは完全な評価・学習・デプロイスクリプトを提供します。eval/配下の複数の評価・統計ツール、data/build_yue_sft.pyデータ構築スクリプト、train/配下のLoRA学習・マージスクリプト、deploy/配下のCUDAおよびAscendデプロイガイドが含まれます。結果ドキュメントには、8Bと30B-A3Bの2つのモデル系列の詳細な比較、プロンプトアブレーション、データアブレーション、量子化実験が記録されています。 モデル重みはHugging Faceのゲート付きリポジトリで公開されており、bf16マージ版、AscendネイティブW8A8動的量子化版、int4版、公開データのみで学習したアブレーション版、LoRAアダプタが含まれます。コードはMITライセンスを採用し、評価に使用するデータセットはそれぞれのライセンスに従います。