इस प्रोजेक्ट के बारे में
KTransformers सिंघुआ विश्वविद्यालय के MADSys Lab, Approaching.AI और 9#AISoft का एक शोध प्रोजेक्ट है, जो हेटरोजीनियस CPU-GPU कंप्यूटिंग के माध्यम से बड़े भाषा मॉडल (LLMs) के कुशल इन्फ्रेंस और फाइन-ट्यूनिंग पर केंद्रित है। यह प्रोजेक्ट दो मुख्य उपयोगकर्ता-मुखी क्षमताएँ प्रदान करता है: अपने `kt-kernel` सर्विंग स्टैक के माध्यम से हाई-परफॉर्मेंस इन्फ्रेंस और LLaMA-Factory के साथ एकीकृत फाइन-ट्यूनिंग (SFT)।
## क्षमताएँ
### इन्फ्रेंस (kt-kernel सर्विंग)
- **AMX/AVX एक्सेलेरेशन**: Intel AMX और AVX512/AVX2 इंस्ट्रक्शन सेट्स का उपयोग करते हुए INT4/INT8 क्वांटाइज़्ड इन्फ्रेंस के लिए ऑप्टिमाइज़्ड केर्नल।
- **MoE ऑप्टिमाइज़ेशन**: NUMA-अवेयर मेमोरी मैनेजमेंट के साथ कुशल Mixture-of-Experts इन्फ्रेंस, जो हेटरोजीनियस एक्सपर्ट प्लेसमेंट को सक्षम बनाता है (हॉट एक्सपर्ट्स GPU पर, कोल्ड एक्सपर्ट्स CPU पर)।
- **क्वांटाइज़ेशन सपोर्ट**: CPU-साइड INT4/INT8 क्वांटाइज़्ड वेट्स और GPU-साइड GPTQ सपोर्ट।
- **इंटीग्रेशन**: SGLang और अन्य सर्विंग फ्रेमवर्क्स के साथ सहज एकीकरण के लिए क्लीन Python API।
- **हार्डवेयर लचीलापन**: NVIDIA GPU, AMD ROCm, Intel Arc GPU और Ascend NPU को सपोर्ट करता है।
### फाइन-ट्यूनिंग (LLaMA-Factory के साथ SFT)
- **अल्ट्रा-लार्ज MoE सपोर्ट**: सीमित GPU मेमोरी पर DeepSeek-V3/R1, Kimi K2.5/K2.6 जैसे मॉडलों को फाइन-ट्यून करें।
- **परफॉर्मेंस**: बेंचमार्क किए गए MoE SFT वर्कलोड में ZeRO-Offload की तुलना में 6-12x ट्रेनिंग स्पीडअप रिपोर्ट करता है, साथ ही CPU मेमोरी उपयोग में कमी।
- **कॉन्फ़िगरेशन**: BF16, FP8, INT8, LoRA और फुल-पैरामीटर फाइन-ट्यूनिंग सपोर्ट करता है।
- **इंटीग्रेशन**: लोकप्रिय LLaMA-Factory फ्रेमवर्क के साथ सहज एकीकरण।
## मॉडल सपोर्ट
KTransformers कई मॉडलों के लिए Day0 सपोर्ट प्रदान करता है, जिनमें DeepSeek-V3/R1/V4-Flash, GLM-4/5/5.2/5.3-flash, Kimi-K2/K2.5/K2.6/Thinking, MiniMax-M2.1/M3, Qwen3-MoE/Next, Mixtral, LLaMA-4 और अन्य शामिल हैं। यह INT4, INT8, FP8 और हाइब्रिड वेट्स सहित विभिन्न क्वांटाइज़ेशन फॉर्मेट्स का भी समर्थन करता है।
## क्विक स्टार्ट
इन्फ्रेंस के लिए:
cd kt-kernel
pip install .
फाइन-ट्यूनिंग के लिए:
cd /path/to/LLaMA-Factory
python -m pip install -e .
python -m pip install "ktransformers[sft]==0.7.0"
python -m pip install "sglang-kt==0.7.0"
CUDA_VISIBLE_DEVICES=0,1,2,3 accelerate launch \
--config_file examples/ktransformers/accelerate/fsdp2_kt_int8.yaml \
src/train.py \
examples/ktransformers/train_lora/qwen3_5moe_lora_sft_kt.yaml
यह प्रोजेक्ट सक्रिय रूप से विकसित किया जा रहा है, नए मॉडलों और सुविधाओं का समर्थन करने वाले लगातार अपडेट के साथ, और अंग्रेजी और चीनी में विस्तृत दस्तावेज़ उपलब्ध हैं।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.