Sobre o projeto
SGLang é uma infraestrutura de serving para modelos de linguagem e multimodais extensos que suporta implantações que variam de GPUs únicas a grandes clusters distribuídos.
As principais capacidades técnicas incluem:
- Runtime Rápido: Apresenta RadixAttention para prefix caching, um escalonador de CPU com zero overhead, desagregação de prefill-decode, decodificação especulativa, continuous batching, paged attention e várias estratégias de paralelismo (tensor, pipeline, expert e data).
- Quantização e Otimização: Suporta quantização FP4, FP8, INT4, AWQ e GPTQ, bem como saídas estruturadas e multi-LoRA batching.
- Amplo Suporte a Modelos: Compatível com Llama, Qwen, DeepSeek, Kimi, GLM, GPT, Gemma e Mistral, além de modelos de embedding, reward e diffusion (ex: WAN, Qwen-Image). É compatível com APIs da OpenAI e com a maioria dos modelos do Hugging Face.
- Compatibilidade de Hardware: Executa em GPUs NVIDIA, GPUs AMD, CPUs Intel Xeon, TPUs Google e NPUs Ascend.
- Integração de RL: Serve como backend de rollout para frameworks de pós-treinamento, incluindo AReaL, Miles, slime, Tunix e verl.