Sobre o projeto
SGLang-Omni é um framework de serviço do projeto SGLang voltado para modelos omni, de fala e de texto para fala. Em vez de tratar a geração como uma única etapa monolítica, ele modela a inferência como um pipeline de estágios coordenados: pré-processamento, codificadores, motores autorregressivos, talkers, decodificadores, vocoders e agregadores. Cada estágio é executado atrás de um agendador adequado à sua carga de trabalho, e um plano de controle coordena as requisições enquanto um plano de dados de retransmissão move cargas úteis de tensores por backends de memória compartilhada, NCCL, NIXL e Mooncake. Quando aplicável, ele se compõe com o SGLang para agendamento autorregressivo e execução de modelos.
O projeto expõe uma superfície de API compatível com OpenAI cobrindo chat multimodal, geração de fala, fala em lote e streaming, vozes enviadas e transcrição de áudio. Um SGLang-Omni Router separado atua como porta de entrada multi-worker com descoberta de saúde, prontidão, ciclo de vida e capacidades.
A cobertura de modelos descrita no README inclui modelos de chat omni e de fala como Qwen3-Omni e Ming-Omni; geração de música com MiniMax Music 3 (letras mais legenda para estéreo de 32 kHz); geração de fala com Higgs Audio v3, MOSS-TTS, MOSS-TTS Local, Fish Speech S2-Pro, Qwen3-TTS, Voxtral TTS, Ming-Omni-TTS, dots.tts e ZONOS2; e transcrição/diarização com Qwen3-ASR, Fun-ASR, ARK-ASR e MOSS-Transcribe-Diarize, este último suportando rótulos de falante e carimbos de data/hora via verbose_json. Entradas recentes de notícias também mencionam suporte a AuK e AuK-Flash para instruções de texto/voz e edição de áudio.
O suporte de hardware está documentado como NVIDIA CUDA (padrão, cobertura total de modelos), Apple Silicon (experimental, Qwen3-ASR via MLX ou Torch MPS no macOS arm64) e Intel XPU (experimental, com Qwen3-ASR, Qwen3-TTS e Qwen3-Omni servindo ponta a ponta e backend detectado automaticamente). A instalação está disponível no PyPI, com um script de instalação de um comando para macOS Apple Silicon, e são fornecidos ampla documentação, cookbook e links de referência para desenvolvedores. O projeto é licenciado sob uma licença de código aberto e recebe contribuições em torno de sistemas de inferência, kernels, agendamento, comunicação entre estágios, executores de modelos, benchmarking e implantação.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.