প্রকল্প সম্পর্কে

KTransformers হল Tsinghua University-এর MADSys Lab, Approaching.AI এবং 9#AISoft-এর একটি গবেষণা প্রকল্প, যা হেটারোজেনিয়াস CPU-GPU কম্পিউটিংয়ের মাধ্যমে বড় ভাষার মডেলগুলির (LLM) কার্যকরী ইনফারেন্স এবং ফাইন-টিউনিংয়ের উপর দৃষ্টি নিবদ্ধ করে। প্রকল্পটি ব্যবহারকারীদের জন্য দুটি প্রধান ক্ষমতা প্রদান করে: তার kt-kernel সার্ভিং স্ট্যাকের মাধ্যমে উচ্চ-পারফরম্যান্স ইনফারেন্স এবং LLaMA-Factory-এর সাথে সংহত ফাইন-টিউনিং (SFT)। ## Capabilities ### Inference (kt-kernel Serving) - **AMX/AVX Acceleration**: Intel AMX এবং AVX512/AVX2 নির্দেশ সেট ব্যবহার করে INT4/INT8 কোয়ান্টাইজড ইনফারেন্সের জন্য অপ্টিমাইজড কার্নেল। - **MoE Optimization**: NUMA-সচেতন মেমোরি ম্যানেজমেন্ট সহ কার্যকরী Mixture-of-Experts ইনফারেন্স, যা হেটারোজেনিয়াস এক্সপার্ট প্লেসমেন্ট সক্ষম করে (হট এক্সপার্ট GPU-তে, কোল্ড এক্সপার্ট CPU-তে)। - **Quantization Support**: CPU-পাশে INT4/INT8 কোয়ান্টাইজড ওয়েট এবং GPU-পাশে GPTQ সমর্থন। - **Integration**: SGLang এবং অন্যান্য সার্ভিং ফ্রেমওয়ার্কের সাথে নির্বিঘ্ন সংহতির জন্য পরিষ্কার Python API। - **Hardware Flexibility**: NVIDIA GPUs, AMD ROCm, Intel Arc GPUs এবং Ascend NPUs সমর্থন করে। ### Fine-Tuning (SFT with LLaMA-Factory) - **Ultra-Large MoE Support**: সীমিত GPU মেমোরিতে DeepSeek-V3/R1, Kimi K2.5/K2.6-এর মতো মডেল ফাইন-টিউন করুন। - **Performance**: বেঞ্চমার্ককৃত MoE SFT কাজে ZeRO-Offload-এর তুলনায় 6-12x প্রশিক্ষণ ত্বরণ রিপোর্ট করে, সাথে CPU মেমোরি ব্যবহার হ্রাস। - **Configurations**: BF16, FP8, INT8, LoRA এবং ফুল-প্যারামিটার ফাইন-টিউনিং সমর্থন করে। - **Integration**: জনপ্রিয় LLaMA-Factory ফ্রেমওয়ার্কের সাথে নির্বিঘ্ন সংহতি। ## Model Support KTransformers অনেক মডেলের জন্য Day0 সমর্থন প্রদান করে, যার মধ্যে রয়েছে DeepSeek-V3/R1/V4-Flash, GLM-4/5/5.2/5.3-flash, Kimi-K2/K2.5/K2.6/Thinking, MiniMax-M2.1/M3, Qwen3-MoE/Next, Mixtral, LLaMA-4 এবং অন্যান্য। এটি INT4, INT8, FP8 এবং হাইব্রিড ওয়েট সহ 다양한 কোয়ান্টাইজেশন ফরম্যাটও সমর্থন করে। ## Quick Start Inference-এর জন্য: cd kt-kernel pip install . Fine-tuning-এর জন্য: cd /path/to/LLaMA-Factory python -m pip install -e . python -m pip install "ktransformers[sft]==0.7.0" python -m pip install "sglang-kt==0.7.0" CUDA_VISIBLE_DEVICES=0,1,2,3 accelerate launch \ --config_file examples/ktransformers/accelerate/fsdp2_kt_int8.yaml \ src/train.py \ examples/ktransformers/train_lora/qwen3_5moe_lora_sft_kt.yaml প্রজেক্টটি সক্রিয়ভাবে উন্নয়ন করা হচ্ছে, নতুন মডেল এবং বৈশিষ্ট্যগুলির সমর্থনে ঘন ঘন আপডেট সহ, এবং ইংরেজি ও চীনা ভাষায় বিস্তারিত ডকুমেন্টেশন উপলব্ধ।