프로젝트 소개

KTransformers는 칭화대학교 MADSys 연구실, Approaching.AI, 9#AISoft의 연구 프로젝트로, CPU-GPU 이기종 컴퓨팅을 통해 대규모 언어 모델(LLM)의 효율적인 추론과 미세 조정에 중점을 둡니다. 이 프로젝트는 사용자에게 두 가지 주요 기능을 제공합니다: `kt-kernel` 서빙 스택을 통한 고성능 추론과 LLaMA-Factory와 통합된 미세 조정(SFT)입니다. ## 기능 ### 추론 (kt-kernel 서빙) - **AMX/AVX 가속**: Intel AMX 및 AVX512/AVX2 명령어 세트를 사용한 INT4/INT8 양자화 추론용 최적화 커널. - **MoE 최적화**: NUMA 인식 메모리 관리를 통한 효율적인 Mixture-of-Experts 추론으로, 이기종 전문가 배치(핫 전문가는 GPU, 콜드 전문가는 CPU)를 지원합니다. - **양자화 지원**: CPU 측 INT4/INT8 양자화 가중치 및 GPU 측 GPTQ 지원. - **통합**: SGLang 및 기타 서빙 프레임워크와 원활하게 통합되는 깔끔한 Python API. - **하드웨어 유연성**: NVIDIA GPU, AMD ROCm, Intel Arc GPU, Ascend NPU를 지원합니다. ### 미세 조정 (LLaMA-Factory와 SFT) - **초대형 MoE 지원**: 제한된 GPU 메모리에서 DeepSeek-V3/R1, Kimi K2.5/K2.6과 같은 모델을 미세 조정할 수 있습니다. - **성능**: 벤치마크된 MoE SFT 작업에서 ZeRO-Offload 대비 6-12배의 훈련 속도 향상을 보고하며, CPU 메모리 사용량도 줄입니다. - **구성**: BF16, FP8, INT8, LoRA 및 전체 파라미터 미세 조정을 지원합니다. - **통합**: 널리 사용되는 LLaMA-Factory 프레임워크와 원활하게 통합됩니다. ## 모델 지원 KTransformers는 DeepSeek-V3/R1/V4-Flash, GLM-4/5/5.2/5.3-flash, Kimi-K2/K2.5/K2.6/Thinking, MiniMax-M2.1/M3, Qwen3-MoE/Next, Mixtral, LLaMA-4 등을 포함한 다양한 모델에 Day0 지원을 제공합니다. 또한 INT4, INT8, FP8 및 하이브리드 가중치를 포함한 다양한 양자화 형식을 지원합니다. ## 빠른 시작 추론의 경우: ```bash cd kt-kernel pip install . ``` 미세 조정의 경우: ```bash cd /path/to/LLaMA-Factory python -m pip install -e . python -m pip install "ktransformers[sft]==0.7.0" python -m pip install "sglang-kt==0.7.0" CUDA_VISIBLE_DEVICES=0,1,2,3 accelerate launch \ --config_file examples/ktransformers/accelerate/fsdp2_kt_int8.yaml \ src/train.py \ examples/ktransformers/train_lora/qwen3_5moe_lora_sft_kt.yaml ``` 이 프로젝트는 활발히 개발 중이며, 새로운 모델과 기능을 지원하는 빈번한 업데이트와 영어 및 중국어로 제공되는 상세 문서를 갖추고 있습니다.