Об этом проекте

Cantonese-LLM-Lab — это открытый проект, посвящённый файнтюнингу кантонской большой языковой модели, её оценке и адаптации под отечественное оборудование Ascend. Он ориентирован на исследователей и инженеров, которые хотят воспроизвести или улучшить кантонскую вопросно-ответную модель. Проект не полагается на оценку с помощью LLM, а предоставляет переиспользуемый объективный оценочный фреймворк: полная оценка по официальной методологии HKMMLU, официальная задача кантонско-путунхуа взаимного перевода, чистота письменного кантонского, детекция деградации и перплексия, а также попарный точный тест МакНемара для всех заданий. Проект состоит из шести основных частей: первая — описанный выше оценочный фреймворк; вторая — метод абляции промптов, использующий схему 2×2 (язык × форматный каркас) для проверки того, зависит ли ранжирование от выбора промпта; третья — шлюз публикации с тестом не меньшей эффективности и проверкой чувствительности δ; четвёртая — инструмент диагностики LoRA, который послойно вычисляет ‖ΔW‖/‖W‖; пятая — скрипт восстановления многоисточниковых кантонских SFT-данных, включающий нормализацию упрощённого и традиционного письма, двухуровневую дедупликацию и обучение после предварительного разрезания; шестая — записи об адаптации под Ascend 910C, охватывающие миграцию с CUDA с изменением всего четырёх строк, нативное квантование W8A8, отрицательные результаты оптимизации в графовом режиме, а также проблему несоответствия сообщений об ошибках фактическим первопричинам. Репозиторий предоставляет полные скрипты оценки, обучения и развертывания, включая несколько инструментов оценки и статистики в eval/, скрипт построения данных data/build_yue_sft.py, скрипты обучения и слияния LoRA в train/, а также руководства по развертыванию для CUDA и Ascend в deploy/. Документы с результатами фиксируют детальное сравнение двух линеек моделей 8B и 30B-A3B, абляцию промптов, абляцию данных и эксперименты с квантованием. Веса моделей опубликованы в гейтированных репозиториях Hugging Face и включают объединённую версию bf16, нативно динамически квантованную версию W8A8 для Ascend, версию int4, абляционную версию, обученную только на открытых данных, и LoRA-адаптер. Код распространяется по лицензии MIT, а использованные для оценки наборы данных подчиняются своим собственным лицензиям.