Об этом проекте
KTransformers — это исследовательский проект лаборатории MADSys Университета Цинхуа, Approaching.AI и 9#AISoft, направленный на эффективный вывод и дообучение больших языковых моделей (LLM) с помощью гетерогенных CPU-GPU вычислений. Проект предоставляет две основные пользовательские возможности: высокопроизводительный вывод через стек обслуживания `kt-kernel` и дообучение (SFT), интегрированное с LLaMA-Factory.
## Возможности
### Вывод (обслуживание через kt-kernel)
- **Ускорение AMX/AVX**: Оптимизированные ядра для вывода с квантованием INT4/INT8 с использованием наборов инструкций Intel AMX и AVX512/AVX2.
- **Оптимизация MoE**: Эффективный вывод Mixture-of-Experts с управлением памятью с учётом NUMA, обеспечивающий гетерогенное размещение экспертов (горячие эксперты на GPU, холодные на CPU).
- **Поддержка квантования**: Квантованные веса INT4/INT8 на стороне CPU и поддержка GPTQ на стороне GPU.
- **Интеграция**: Чистый Python API для бесшовной интеграции с SGLang и другими фреймворками обслуживания.
- **Гибкость оборудования**: Поддержка NVIDIA GPU, AMD ROCm, Intel Arc GPU и Ascend NPU.
### Дообучение (SFT с LLaMA-Factory)
- **Поддержка сверхбольших MoE**: Дообучение моделей типа DeepSeek-V3/R1, Kimi K2.5/K2.6 при ограниченной памяти GPU.
- **Производительность**: Сообщается об ускорении обучения в 6–12 раз по сравнению с ZeRO-Offload в тестовых MoE SFT-нагрузках, при снижении использования памяти CPU.
- **Конфигурации**: Поддержка BF16, FP8, INT8, LoRA и полного дообучения всех параметров.
- **Интеграция**: Бесшовная интеграция с популярным фреймворком LLaMA-Factory.
## Поддержка моделей
KTransformers обеспечивает поддержку Day0 для широкого круга моделей, включая DeepSeek-V3/R1/V4-Flash, GLM-4/5/5.2/5.3-flash, Kimi-K2/K2.5/K2.6/Thinking, MiniMax-M2.1/M3, Qwen3-MoE/Next, Mixtral, LLaMA-4 и другие. Также поддерживаются различные форматы квантования, включая INT4, INT8, FP8 и гибридные веса.
## Быстрый старт
Для вывода:
```bash
cd kt-kernel
pip install .
```
Для дообучения:
```bash
cd /path/to/LLaMA-Factory
python -m pip install -e .
python -m pip install "ktransformers[sft]==0.7.0"
python -m pip install "sglang-kt==0.7.0"
CUDA_VISIBLE_DEVICES=0,1,2,3 accelerate launch \
--config_file examples/ktransformers/accelerate/fsdp2_kt_int8.yaml \
src/train.py \
examples/ktransformers/train_lora/qwen3_5moe_lora_sft_kt.yaml
```
Проект активно развивается, регулярно выпускаются обновления с поддержкой новых моделей и функций, а подробная документация доступна на английском и китайском языках.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.