Sobre el proyecto
KTransformers es un proyecto de investigación del laboratorio MADSys de la Universidad de Tsinghua, Approaching.AI y 9#AISoft, centrado en la inferencia y el ajuste fino eficientes de grandes modelos de lenguaje (LLMs) mediante computación heterogénea CPU-GPU. El proyecto ofrece dos capacidades principales para el usuario: inferencia de alto rendimiento a través de su pila de servicios `kt-kernel` y ajuste fino (SFT) integrado con LLaMA-Factory.
## Capacidades
### Inferencia (servicio kt-kernel)
- **Aceleración AMX/AVX**: kernels optimizados para inferencia cuantizada INT4/INT8 mediante los conjuntos de instrucciones Intel AMX y AVX512/AVX2.
- **Optimización MoE**: inferencia eficiente de Mixture-of-Experts con gestión de memoria consciente de NUMA, lo que permite la colocación heterogénea de expertos (expertos calientes en GPU, expertos fríos en CPU).
- **Soporte de cuantización**: pesos cuantizados INT4/INT8 en el lado de la CPU y soporte GPTQ en el lado de la GPU.
- **Integración**: API Python limpia para una integración sin fricciones con SGLang y otros marcos de servicio.
- **Flexibilidad de hardware**: soporta GPUs NVIDIA, AMD ROCm, GPUs Intel Arc y NPUs Ascend.
### Ajuste fino (SFT con LLaMA-Factory)
- **Soporte de MoE ultra grandes**: ajuste fino de modelos como DeepSeek-V3/R1, Kimi K2.5/K2.6 con memoria de GPU limitada.
- **Rendimiento**: reporta una aceleración de entrenamiento de 6 a 12 veces en comparación con ZeRO-Offload en cargas de trabajo SFT MoE evaluadas, con un uso reducido de memoria de CPU.
- **Configuraciones**: soporta BF16, FP8, INT8, LoRA y ajuste fino de parámetros completos.
- **Integración**: integración sin fricciones con el popular marco LLaMA-Factory.
## Soporte de modelos
KTransformers ofrece soporte desde el primer día para una amplia gama de modelos, incluyendo DeepSeek-V3/R1/V4-Flash, GLM-4/5/5.2/5.3-flash, Kimi-K2/K2.5/K2.6/Thinking, MiniMax-M2.1/M3, Qwen3-MoE/Next, Mixtral, LLaMA-4 y otros. También admite varios formatos de cuantización, incluyendo INT4, INT8, FP8 y pesos híbridos.
## Inicio rápido
Para inferencia:
```bash
cd kt-kernel
pip install .
```
Para ajuste fino:
```bash
cd /path/to/LLaMA-Factory
python -m pip install -e .
python -m pip install "ktransformers[sft]==0.7.0"
python -m pip install "sglang-kt==0.7.0"
CUDA_VISIBLE_DEVICES=0,1,2,3 accelerate launch \
--config_file examples/ktransformers/accelerate/fsdp2_kt_int8.yaml \
src/train.py \
examples/ktransformers/train_lora/qwen3_5moe_lora_sft_kt.yaml
```
El proyecto se encuentra en desarrollo activo, con actualizaciones frecuentes que incorporan nuevos modelos y características, y documentación detallada disponible en inglés y chino.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.