Об этом проекте

SGLang представляет собой инфраструктуру обслуживания больших языковых и мультимодальных моделей, поддерживающую развертывание от одного GPU до крупных распределенных кластеров. Ключевые технические возможности включают: - Быстрый Runtime: включает RadixAttention для кэширования префиксов, планировщик CPU с нулевыми накладными расходами, разделение prefill-decode, спекулятивное декодирование, непрерывное пакетирование (continuous batching), paged attention и различные стратегии параллелизма (тензорный, конвейерный, экспертный и по данным). - Квантование и оптимизация: поддержка квантования FP4, FP8, INT4, AWQ и GPTQ, а также структурированного вывода и пакетной обработки multi-LoRA. - Широкая поддержка моделей: совместимость с Llama, Qwen, DeepSeek, Kimi, GLM, GPT, Gemma и Mistral, а также с моделями эмбеддингов, вознаграждения и диффузионными моделями (например, WAN, Qwen-Image). Совместим с OpenAI API и большинством моделей Hugging Face. - Аппаратная совместимость: работает на NVIDIA GPU, AMD GPU, Intel Xeon CPU, Google TPU и Ascend NPU. - Интеграция с RL: служит бэкендом для развертывания (rollout backend) в рамках фреймворков пост-обучения, включая AReaL, Miles, slime, Tunix и verl.