इस प्रोजेक्ट के बारे में

KTransformers सिंघुआ विश्वविद्यालय के MADSys Lab, Approaching.AI और 9#AISoft का एक शोध प्रोजेक्ट है, जो हेटरोजीनियस CPU-GPU कंप्यूटिंग के माध्यम से बड़े भाषा मॉडल (LLMs) के कुशल इन्फ्रेंस और फाइन-ट्यूनिंग पर केंद्रित है। यह प्रोजेक्ट दो मुख्य उपयोगकर्ता-मुखी क्षमताएँ प्रदान करता है: अपने `kt-kernel` सर्विंग स्टैक के माध्यम से हाई-परफॉर्मेंस इन्फ्रेंस और LLaMA-Factory के साथ एकीकृत फाइन-ट्यूनिंग (SFT)। ## क्षमताएँ ### इन्फ्रेंस (kt-kernel सर्विंग) - **AMX/AVX एक्सेलेरेशन**: Intel AMX और AVX512/AVX2 इंस्ट्रक्शन सेट्स का उपयोग करते हुए INT4/INT8 क्वांटाइज़्ड इन्फ्रेंस के लिए ऑप्टिमाइज़्ड केर्नल। - **MoE ऑप्टिमाइज़ेशन**: NUMA-अवेयर मेमोरी मैनेजमेंट के साथ कुशल Mixture-of-Experts इन्फ्रेंस, जो हेटरोजीनियस एक्सपर्ट प्लेसमेंट को सक्षम बनाता है (हॉट एक्सपर्ट्स GPU पर, कोल्ड एक्सपर्ट्स CPU पर)। - **क्वांटाइज़ेशन सपोर्ट**: CPU-साइड INT4/INT8 क्वांटाइज़्ड वेट्स और GPU-साइड GPTQ सपोर्ट। - **इंटीग्रेशन**: SGLang और अन्य सर्विंग फ्रेमवर्क्स के साथ सहज एकीकरण के लिए क्लीन Python API। - **हार्डवेयर लचीलापन**: NVIDIA GPU, AMD ROCm, Intel Arc GPU और Ascend NPU को सपोर्ट करता है। ### फाइन-ट्यूनिंग (LLaMA-Factory के साथ SFT) - **अल्ट्रा-लार्ज MoE सपोर्ट**: सीमित GPU मेमोरी पर DeepSeek-V3/R1, Kimi K2.5/K2.6 जैसे मॉडलों को फाइन-ट्यून करें। - **परफॉर्मेंस**: बेंचमार्क किए गए MoE SFT वर्कलोड में ZeRO-Offload की तुलना में 6-12x ट्रेनिंग स्पीडअप रिपोर्ट करता है, साथ ही CPU मेमोरी उपयोग में कमी। - **कॉन्फ़िगरेशन**: BF16, FP8, INT8, LoRA और फुल-पैरामीटर फाइन-ट्यूनिंग सपोर्ट करता है। - **इंटीग्रेशन**: लोकप्रिय LLaMA-Factory फ्रेमवर्क के साथ सहज एकीकरण। ## मॉडल सपोर्ट KTransformers कई मॉडलों के लिए Day0 सपोर्ट प्रदान करता है, जिनमें DeepSeek-V3/R1/V4-Flash, GLM-4/5/5.2/5.3-flash, Kimi-K2/K2.5/K2.6/Thinking, MiniMax-M2.1/M3, Qwen3-MoE/Next, Mixtral, LLaMA-4 और अन्य शामिल हैं। यह INT4, INT8, FP8 और हाइब्रिड वेट्स सहित विभिन्न क्वांटाइज़ेशन फॉर्मेट्स का भी समर्थन करता है। ## क्विक स्टार्ट इन्फ्रेंस के लिए: cd kt-kernel pip install . फाइन-ट्यूनिंग के लिए: cd /path/to/LLaMA-Factory python -m pip install -e . python -m pip install "ktransformers[sft]==0.7.0" python -m pip install "sglang-kt==0.7.0" CUDA_VISIBLE_DEVICES=0,1,2,3 accelerate launch \ --config_file examples/ktransformers/accelerate/fsdp2_kt_int8.yaml \ src/train.py \ examples/ktransformers/train_lora/qwen3_5moe_lora_sft_kt.yaml यह प्रोजेक्ट सक्रिय रूप से विकसित किया जा रहा है, नए मॉडलों और सुविधाओं का समर्थन करने वाले लगातार अपडेट के साथ, और अंग्रेजी और चीनी में विस्तृत दस्तावेज़ उपलब्ध हैं।