À propos du projet
SGLang est une infrastructure de service pour les grands modèles de langage et multimodaux qui prend en charge des déploiements allant d'un seul GPU à de grands clusters distribués.
Les capacités techniques clés incluent :
- Runtime Rapide : dispose de RadixAttention pour la mise en cache de préfixes, d'un ordonnanceur CPU sans surcharge, de la désagrégation prefill-decode, du décodage spéculatif, du batching continu, de la paged attention et de diverses stratégies de parallélisme (tensor, pipeline, expert et data).
- Quantification et Optimisation : prend en charge la quantification FP4, FP8, INT4, AWQ et GPTQ, ainsi que les sorties structurées et le batching multi-LoRA.
- Large Support de Modèles : compatible avec Llama, Qwen, DeepSeek, Kimi, GLM, GPT, Gemma et Mistral, ainsi qu'avec les modèles d'embedding, de récompense et de diffusion (par exemple, WAN, Qwen-Image). Il est compatible avec les API OpenAI et la plupart des modèles Hugging Face.
- Compatibilité Matérielle : fonctionne sur les GPU NVIDIA, les GPU AMD, les CPU Intel Xeon, les TPU Google et les NPU Ascend.
- Intégration RL : sert de backend de rollout pour les frameworks de post-entraînement incluant AReaL, Miles, slime, Tunix et verl.