প্রকল্প সম্পর্কে
SGLang হলো লার্জ ল্যাঙ্গুয়েজ এবং মাল্টিমোডাল মডেলের জন্য একটি সার্ভিং ইনফ্রাস্ট্রাকচার যা একক GPU থেকে শুরু করে বড় ডিস্ট্রিবিউটেড ক্লাস্টার পর্যন্ত ডেপ্লয়মেন্ট সমর্থন করে।
এর প্রধান প্রযুক্তিগত সক্ষমতাগুলোর মধ্যে রয়েছে:
- Fast Runtime: এতে প্রিফিক্স ক্যাশিংয়ের জন্য RadixAttention, একটি জিরো-ওভারহেড CPU শিডিউলার, prefill-decode disaggregation, speculative decoding, continuous batching, paged attention এবং বিভিন্ন প্যারালালিজম স্ট্র্যাটেজি (tensor, pipeline, expert, এবং data) রয়েছে।
- Quantization ও Optimization: এটি FP4, FP8, INT4, AWQ এবং GPTQ কোয়ান্টাইজেশন সহ structured outputs এবং multi-LoRA batching সমর্থন করে।
- বিস্তৃত মডেল সমর্থন: এটি Llama, Qwen, DeepSeek, Kimi, GLM, GPT, Gemma এবং Mistral-এর পাশাপাশি embedding, reward এবং diffusion মডেলের (যেমন: WAN, Qwen-Image) সাথে সামঞ্জস্যপূর্ণ। এটি OpenAI API এবং অধিকাংশ Hugging Face মডেলের সাথে কাজ করে।
- হার্ডওয়্যার সামঞ্জস্যতা: এটি NVIDIA GPU, AMD GPU, Intel Xeon CPU, Google TPU এবং Ascend NPU-তে চলে।
- RL ইন্টিগ্রেশন: এটি AReaL, Miles, slime, Tunix এবং verl-এর মতো পোস্ট-ট্রেনিং ফ্রেমওয়ার্কের জন্য একটি রোলআউট ব্যাকএন্ড হিসেবে কাজ করে।