À propos du projet

SGLang-Omni est un framework de service issu du projet SGLang destiné aux modèles omni, vocaux et de synthèse vocale. Plutôt que de traiter la génération comme une étape monolithique unique, il modélise l'inférence comme un pipeline d'étapes coordonnées : prétraitement, encodeurs, moteurs autorégressifs, talkers, décodeurs, vocodeurs et agrégateurs. Chaque étape s'exécute derrière un ordonnanceur adapté à sa charge de travail, et un plan de contrôle coordonne les requêtes tandis qu'un plan de données relais déplace les charges utiles de tenseurs à travers les backends de mémoire partagée, NCCL, NIXL et Mooncake. Le cas échéant, il se compose avec SGLang pour l'ordonnancement autorégressif et l'exécution des modèles. Le projet expose une surface d'API compatible OpenAI couvrant le chat multimodal, la génération vocale, la parole par lots et en streaming, les voix téléversées et la transcription audio. Un routeur SGLang-Omni distinct agit comme une porte d'entrée multi-workers avec découverte de santé, de disponibilité, de cycle de vie et de capacités. La couverture des modèles décrite dans le README inclut des modèles de chat omni et vocaux tels que Qwen3-Omni et Ming-Omni ; la génération musicale avec MiniMax Music 3 (paroles plus légende vers stéréo 32 kHz) ; la génération vocale avec Higgs Audio v3, MOSS-TTS, MOSS-TTS Local, Fish Speech S2-Pro, Qwen3-TTS, Voxtral TTS, Ming-Omni-TTS, dots.tts et ZONOS2 ; et la transcription/diarisation avec Qwen3-ASR, Fun-ASR, ARK-ASR et MOSS-Transcribe-Diarize, ce dernier prenant en charge les étiquettes de locuteur et les horodatages via verbose_json. Des entrées récentes mentionnent également la prise en charge d'AuK et AuK-Flash pour les instructions texte/voix et l'édition audio. La prise en charge matérielle est documentée comme suit : NVIDIA CUDA (par défaut, couverture complète des modèles), Apple Silicon (expérimental, Qwen3-ASR via MLX ou Torch MPS sur macOS arm64) et Intel XPU (expérimental, avec Qwen3-ASR, Qwen3-TTS et Qwen3-Omni servis de bout en bout et backend auto-détecté). L'installation est disponible depuis PyPI, avec un script d'installation en une commande pour macOS Apple Silicon, et des liens étendus vers la documentation, le cookbook et la référence développeur sont fournis. Le projet est sous licence open source et accueille les contributions autour des systèmes d'inférence, des kernels, de l'ordonnancement, de la communication entre étapes, des runners de modèles, du benchmarking et du déploiement.