Sobre o projeto

SGLang é uma infraestrutura de serving para modelos de linguagem e multimodais extensos que suporta implantações que variam de GPUs únicas a grandes clusters distribuídos. As principais capacidades técnicas incluem: - Runtime Rápido: Apresenta RadixAttention para prefix caching, um escalonador de CPU com zero overhead, desagregação de prefill-decode, decodificação especulativa, continuous batching, paged attention e várias estratégias de paralelismo (tensor, pipeline, expert e data). - Quantização e Otimização: Suporta quantização FP4, FP8, INT4, AWQ e GPTQ, bem como saídas estruturadas e multi-LoRA batching. - Amplo Suporte a Modelos: Compatível com Llama, Qwen, DeepSeek, Kimi, GLM, GPT, Gemma e Mistral, além de modelos de embedding, reward e diffusion (ex: WAN, Qwen-Image). É compatível com APIs da OpenAI e com a maioria dos modelos do Hugging Face. - Compatibilidade de Hardware: Executa em GPUs NVIDIA, GPUs AMD, CPUs Intel Xeon, TPUs Google e NPUs Ascend. - Integração de RL: Serve como backend de rollout para frameworks de pós-treinamento, incluindo AReaL, Miles, slime, Tunix e verl.