منصوبے کے بارے میں
SGLang بڑے لسانی اور ملٹی موڈل ماڈلز کے لیے ایک سرونگ انفراسٹرکچر ہے جو سنگل GPUs سے لے کر بڑے ڈسٹری بیوٹڈ کلسٹرز تک کی تعیناتیاں سپورٹ کرتا ہے۔
اہم تکنیکی صلاحیتوں میں شامل ہیں:
- Fast Runtime: اس میں prefix caching کے لیے RadixAttention، ایک زیرو اوور ہیڈ CPU scheduler، prefill-decode disaggregation، speculative decoding، continuous batching، paged attention، اور مختلف پیراللزم حکمت عملیوں (tensor, pipeline, expert, اور data) کی خصوصیات موجود ہیں۔
- Quantization & Optimization: یہ FP4, FP8, INT4, AWQ, اور GPTQ quantization کے ساتھ ساتھ structured outputs اور multi-LoRA batching کو سپورٹ کرتا ہے۔
- Broad Model Support: یہ Llama, Qwen, DeepSeek, Kimi, GLM, GPT, Gemma, اور Mistral کے ساتھ ساتھ embedding, reward, اور diffusion ماڈلز (مثلاً WAN, Qwen-Image) کے ساتھ ہم آہنگ ہے۔ یہ OpenAI APIs اور زیادہ تر Hugging Face ماڈلز کے ساتھ بھی مطابقت رکھتا ہے۔
- Hardware Compatibility: یہ NVIDIA GPUs, AMD GPUs, Intel Xeon CPUs, Google TPUs, اور Ascend NPUs پر چلتا ہے۔
- RL Integration: یہ AReaL, Miles, slime, Tunix, اور verl سمیت پوسٹ ٹریننگ فریم ورکس کے لیے ایک rollout backend کے طور پر کام کرتا ہے۔