这个项目能做什么
MOSS-TTS Family 提供五个可用于生产环境的模型,覆盖多样化的音频生成任务。MOSS-TTS(旗舰模型)提供高保真零样本语音克隆,具备长篇稳定性、token 级时长控制、拼音/IPA 发音控制以及多语言/语码转换合成能力。MOSS-TTSD 专注于面向播客和配音的表现力丰富的多说话人对话生成。MOSS-VoiceGenerator 无需参考语音,即可根据文本提示创建多样化的声音与风格。MOSS-TTS-Realtime 为语音智能体提供低延迟流式能力,TTFB 为 180 毫秒。MOSS-SoundEffect 可生成环境声、城市场景、生物声音以及音乐片段,最长 30 秒,采样率 48kHz。
两大核心架构:MossTTSDelay(采用延迟模式调度的多头并行 RVQ)强调长上下文稳定性与生产就绪性;MossTTSLocal(采用深度 transformer 的时间同步 RVQ 模块)强调面向流式场景的轻量灵活性。MossTTSRealtime 增加了分层文本-音频建模,以实现多轮上下文感知。
已发布的模型检查点参数规模从 1.7B 到 8B 不等,v1.5 更新通过语言标签增强了多语言合成能力、语音克隆更加稳定、改进了长参考短文本处理、支持跟随标点的韵律,以及通过 `[pause X.Ys]` 标记实现显式停顿控制。MOSS-TTS-Local-Transformer-v1.5 使用 MOSS-Audio-Tokenizer-v2 实现原生 48kHz 立体声输出。
推理后端包括 SGLang-Omni(Day-0 支持 MossTTSLocal)、vLLM-Omni(支持全系列),以及结合 ONNX Runtime 的 llama.cpp,可实现无 PyTorch 部署(提供 GGUF 权重)。微调教程涵盖 MossTTSDelay、MossTTSLocal 和 MossTTSRealtime 架构。模型托管于 Hugging Face 和 ModelScope,并可通过 SGLang 提供 OpenAI 兼容的 API 端点。
评论
0 评分人数达到10人后显示
登录后参与讨论。