Sobre o projeto
KTransformers é um projeto de pesquisa do MADSys Lab da Universidade de Tsinghua, em parceria com Approaching.AI e 9#AISoft, focado em inferência eficiente e ajuste fino de grandes modelos de linguagem (LLMs) por meio de computação heterogênea CPU-GPU. O projeto oferece duas principais capacidades para o usuário: inferência de alto desempenho via sua stack de serving `kt-kernel` e ajuste fino (SFT) integrado com LLaMA-Factory.
## Capacidades
### Inferência (Serving kt-kernel)
- **Aceleração AMX/AVX**: Kernels otimizados para inferência quantizada INT4/INT8 usando conjuntos de instruções Intel AMX e AVX512/AVX2.
- **Otimização de MoE**: Inferência eficiente de Mixture-of-Experts com gerenciamento de memória ciente de NUMA, permitindo posicionamento heterogêneo de especialistas (especialistas quentes na GPU, especialistas frios na CPU).
- **Suporte a Quantização**: Pesos quantizados INT4/INT8 no lado da CPU e suporte a GPTQ no lado da GPU.
- **Integração**: API Python limpa para integração perfeita com SGLang e outros frameworks de serving.
- **Flexibilidade de Hardware**: Suporta GPUs NVIDIA, AMD ROCm, GPUs Intel Arc e NPUs Ascend.
### Ajuste Fino (SFT com LLaMA-Factory)
- **Suporte a MoE Ultra-Grande**: Ajuste fino de modelos como DeepSeek-V3/R1, Kimi K2.5/K2.6 com memória GPU limitada.
- **Desempenho**: Relata aceleração de treinamento de 6 a 12 vezes em comparação com ZeRO-Offload em cargas de trabalho SFT MoE avaliadas, com uso reduzido de memória da CPU.
- **Configurações**: Suporta BF16, FP8, INT8, LoRA e ajuste fino de parâmetros completos.
- **Integração**: Integração perfeita com o popular framework LLaMA-Factory.
## Suporte a Modelos
KTransformers oferece suporte Day0 para uma ampla gama de modelos, incluindo DeepSeek-V3/R1/V4-Flash, GLM-4/5/5.2/5.3-flash, Kimi-K2/K2.5/K2.6/Thinking, MiniMax-M2.1/M3, Qwen3-MoE/Next, Mixtral, LLaMA-4 e outros. Também suporta diversos formatos de quantização, incluindo INT4, INT8, FP8 e pesos híbridos.
## Início Rápido
Para inferência:
cd kt-kernel
pip install .
Para ajuste fino:
cd /path/to/LLaMA-Factory
python -m pip install -e .
python -m pip install "ktransformers[sft]==0.7.0"
python -m pip install "sglang-kt==0.7.0"
CUDA_VISIBLE_DEVICES=0,1,2,3 accelerate launch \
--config_file examples/ktransformers/accelerate/fsdp2_kt_int8.yaml \
src/train.py \
examples/ktransformers/train_lora/qwen3_5moe_lora_sft_kt.yaml
O projeto é desenvolvido ativamente, com atualizações frequentes que suportam novos modelos e recursos, e documentação detalhada disponível em inglês e chinês.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.