Sobre el proyecto

SGLang-Omni es un framework de servicio del proyecto SGLang orientado a modelos omni, de voz y de texto a voz. En lugar de tratar la generación como un paso monolítico único, modela la inferencia como un pipeline de etapas coordinadas: preprocesamiento, codificadores, motores autorregresivos, habladores, decodificadores, vocoders y agregadores. Cada etapa se ejecuta detrás de un programador adaptado a su carga de trabajo, y un plano de control coordina las solicitudes mientras que un plano de datos de retransmisión mueve cargas útiles de tensores a través de backends de memoria compartida, NCCL, NIXL y Mooncake. Cuando corresponde, se compone con SGLang para la programación autorregresiva y la ejecución de modelos. El proyecto expone una superficie de API compatible con OpenAI que cubre chat multimodal, generación de voz, voz por lotes y en streaming, voces cargadas y transcripción de audio. Un SGLang-Omni Router separado actúa como puerta de entrada de múltiples trabajadores con descubrimiento de salud, preparación, ciclo de vida y capacidades. La cobertura de modelos descrita en el README incluye modelos de chat omni y de voz como Qwen3-Omni y Ming-Omni; generación de música con MiniMax Music 3 (letras más descripción a estéreo de 32 kHz); generación de voz con Higgs Audio v3, MOSS-TTS, MOSS-TTS Local, Fish Speech S2-Pro, Qwen3-TTS, Voxtral TTS, Ming-Omni-TTS, dots.tts y ZONOS2; y transcripción/diarización con Qwen3-ASR, Fun-ASR, ARK-ASR y MOSS-Transcribe-Diarize, este último con soporte de etiquetas de hablante y marcas de tiempo mediante verbose_json. Entradas de noticias recientes también mencionan soporte de AuK y AuK-Flash para instrucciones de texto/voz y edición de audio. El soporte de hardware está documentado como NVIDIA CUDA (predeterminado, cobertura completa de modelos), Apple Silicon (experimental, Qwen3-ASR mediante MLX o Torch MPS en macOS arm64) e Intel XPU (experimental, con Qwen3-ASR, Qwen3-TTS y Qwen3-Omni sirviendo de extremo a extremo y backend auto-detectado). La instalación está disponible desde PyPI, con un script de instalación de un comando para macOS Apple Silicon, y se proporcionan extensos enlaces de documentación, libro de recetas y referencia para desarrolladores. El proyecto está licenciado bajo una licencia de código abierto y acepta contribuciones en torno a sistemas de inferencia, kernels, programación, comunicación entre etapas, ejecutores de modelos, evaluación comparativa y despliegue.