عن المشروع
SGLang هو بنية تحتية لتقديم النماذج اللغوية الكبيرة والنماذج متعددة الوسائط، يدعم عمليات النشر التي تتراوح من وحدات GPU واحدة إلى المجموعات الموزعة الكبيرة.
تشمل القدرات التقنية الرئيسية ما يلي:
- وقت تشغيل سريع: يتميز بـ RadixAttention لتخزين البادئة المؤقت (prefix caching)، وجدولة CPU بدون نفقات إضافية، وفصل prefill-decode، وفك التشفير التخميني (speculative decoding)، والدفع المستمر (continuous batching)، و paged attention، واستراتيجيات توازي متنوعة (tensor و pipeline و expert و data).
- التكميم والتحسين: يدعم تكميم FP4 و FP8 و INT4 و AWQ و GPTQ، بالإضافة إلى المخرجات المهيكلة و multi-LoRA batching.
- دعم واسع للنماذج: متوافق مع Llama و Qwen و DeepSeek و Kimi و GLM و GPT و Gemma و Mistral، بالإضافة إلى نماذج embedding و reward و diffusion (مثل WAN و Qwen-Image). كما أنه متوافق مع OpenAI APIs ومعظم نماذج Hugging Face.
- التوافق مع الأجهزة: يعمل على NVIDIA GPUs و AMD GPUs و Intel Xeon CPUs و Google TPUs و Ascend NPUs.
- تكامل RL: يعمل كخلفية rollout لأطر عمل ما بعد التدريب بما في ذلك AReaL و Miles و slime و Tunix و verl.