Об этом проекте
SGLang представляет собой инфраструктуру обслуживания больших языковых и мультимодальных моделей, поддерживающую развертывание от одного GPU до крупных распределенных кластеров.
Ключевые технические возможности включают:
- Быстрый Runtime: включает RadixAttention для кэширования префиксов, планировщик CPU с нулевыми накладными расходами, разделение prefill-decode, спекулятивное декодирование, непрерывное пакетирование (continuous batching), paged attention и различные стратегии параллелизма (тензорный, конвейерный, экспертный и по данным).
- Квантование и оптимизация: поддержка квантования FP4, FP8, INT4, AWQ и GPTQ, а также структурированного вывода и пакетной обработки multi-LoRA.
- Широкая поддержка моделей: совместимость с Llama, Qwen, DeepSeek, Kimi, GLM, GPT, Gemma и Mistral, а также с моделями эмбеддингов, вознаграждения и диффузионными моделями (например, WAN, Qwen-Image). Совместим с OpenAI API и большинством моделей Hugging Face.
- Аппаратная совместимость: работает на NVIDIA GPU, AMD GPU, Intel Xeon CPU, Google TPU и Ascend NPU.
- Интеграция с RL: служит бэкендом для развертывания (rollout backend) в рамках фреймворков пост-обучения, включая AReaL, Miles, slime, Tunix и verl.