这个项目能做什么
SGLang-Omni 是 SGLang 项目中的一个服务框架,旨在支持全模态、语音和文本转语音模型。它不将生成视为单一的、整体式的步骤,而是将推理建模为一系列协调阶段的流水线:预处理、编码器、自回归引擎、说话者、解码器、声码器和聚合器。每个阶段都在一个适合其工作负载的调度器后运行,控制平面协调请求,而中继数据平面则通过共享内存、NCCL、NIXL 和 Mooncake 后端移动张量负载。在适用的情况下,它与 SGLang 组合用于自回归调度和模型执行。
该项目提供了一个兼容 OpenAI 的 API 接口,涵盖多模态聊天、语音生成、批量和流式语音、上传的声音以及音频转录。一个独立的 SGLang-Omni 路由器作为多工作节点的前端,提供健康检查、就绪状态、生命周期和能力发现功能。
README 中描述的模型覆盖范围包括全模态聊天和语音模型,如 Qwen3-Omni 和 Ming-Omni;使用 MiniMax Music 3 进行音乐生成(歌词加字幕到 32 kHz 立体声);使用 Higgs Audio v3、MOSS-TTS、MOSS-TTS Local、Fish Speech S2-Pro、Qwen3-TTS、Voxtral TTS、Ming-Omni-TTS、dots.tts 和 ZONOS2 进行语音生成;以及使用 Qwen3-ASR、Fun-ASR、ARK-ASR 和 MOSS-Transcribe-Diarize 进行转录/说话人分离,后者通过 verbose_json 支持说话人标签和时间戳。最近的新闻条目还提到支持 AuK 和 AuK-Flash,用于文本/语音指令和音频编辑。
硬件支持被记录为 NVIDIA CUDA(默认,完整模型覆盖)、Apple Silicon(实验性,通过 MLX 或 Torch MPS 在 macOS arm64 上支持 Qwen3-ASR)和 Intel XPU(实验性,支持 Qwen3-ASR、Qwen3-TTS 和 Qwen3-Omni 端到端服务,并自动检测后端)。安装可从 PyPI 获取,并提供适用于 macOS Apple Silicon 的一键安装脚本,以及广泛的文档、食谱和开发者参考链接。该项目采用开源许可证,欢迎围绕推理系统、内核、调度、阶段间通信、模型运行器、基准测试和部署做出贡献。
评论
0 人表达喜爱 · 满10人后显示 Deer Point
登录后参与讨论。