Sobre el proyecto

SGLang es una infraestructura de servicio para modelos multimodales y de lenguaje extensos que admite despliegues que van desde GPUs individuales hasta grandes clústeres distribuidos. Las capacidades técnicas clave incluyen: - Runtime Rápido: Cuenta con RadixAttention para el almacenamiento en caché de prefijos, un programador de CPU sin sobrecarga, desagregación de prefill-decode, decodificación especulativa, batching continuo, paged attention y diversas estrategias de paralelismo (tensor, pipeline, expert y data). - Cuantización y Optimización: Admite cuantización FP4, FP8, INT4, AWQ y GPTQ, así como salidas estructuradas y batching multi-LoRA. - Amplio Soporte de Modelos: Compatible con Llama, Qwen, DeepSeek, Kimi, GLM, GPT, Gemma y Mistral, así como modelos de embedding, recompensa y difusión (por ejemplo, WAN, Qwen-Image). Es compatible con las APIs de OpenAI y la mayoría de los modelos de Hugging Face. - Compatibilidad de Hardware: Se ejecuta en GPUs de NVIDIA, GPUs de AMD, CPUs de Intel Xeon, TPUs de Google y NPUs de Ascend. - Integración de RL: Sirve como backend de rollout para marcos de post-entrenamiento, incluyendo AReaL, Miles, slime, Tunix y verl.