这个项目能做什么

MOSS-TTS-Nano 是 MOSI.AI 和 OpenMOSS 团队开发的开源多语言语音生成模型。该模型约有0.1B参数,专注于实时语音生成,可在无GPU的CPU上运行,简化了本地演示、Web服务和轻量级集成的部署流程。 README 中描述的主要特性: - 模型规模小,约0.1B参数。 - 原生支持48kHz双声道(立体声)音频输出。 - 多语言支持,涵盖20种语言,包括中文、英语、德语、西班牙语、法语、日语、意大利语、匈牙利语、韩语、俄语、波斯语、阿拉伯语、波兰语、葡萄牙语、捷克语、丹麦语、瑞典语、希腊语和土耳其语。 - 纯自回归架构,基于音频分词器和LLM流水线构建。 - 流式推理,实时延迟低,首音频响应快。 - 对CPU友好:流式生成可在4核CPU上运行。 - 长文本处理能力,支持自动分块声音克隆。 - 开源部署路径,包括直接Python脚本和打包的CLI。 快速开始:README 建议使用干净的Python环境,克隆仓库,安装依赖,并以可编辑模式安装项目,以便使用 moss-tts-nano 命令。默认模型加载使用 OpenMOSS-Team/MOSS-TTS-Nano 和 OpenMOSS-Team/MOSS-Audio-Tokenizer-Nano。声音克隆是主要推荐工作流,通过 infer.py 演示,使用提示音频路径和输入文本。本地FastAPI Web演示可通过 app.py 启动,并在 127.0.0.1:18083 访问。 ONNX CPU推理:推荐使用ONNX CPU版本进行轻量级本地部署。它在推理时移除PyTorch依赖,在ONNX Runtime CPU上运行,支持直接参考音频、内置语音和实时流式解码,项目测试中描述其处理效率比原始版本提高近2倍。在MacBook Air M4上,单CPU核心即可实现流畅推理。ONNX入口包括 infer_onnx.py、app_onnx.py 和带 --backend onnx 的打包CLI。CUDA执行可通过 onnxruntime-gpu 和 --execution-provider cuda 可选启用。首次运行时,缺失的模型文件会从ONNX Hugging Face仓库下载。 附加工具:examples/android_onnx_runtime 下的Android ONNX Runtime示例在设备上加载导出的ONNX图并写入WAV文件。onnx/ 下的导出器将本地Hugging Face格式检查点转换为仅TTS的ONNX模型目录。打包CLI提供 moss-tts-nano generate 和 moss-tts-nano serve 命令,支持提示语音、文本文件、后端选择和执行提供程序选项。微调代码和教程在 finetuning 目录中提供。 该仓库还记录了 MOSS-Audio-Tokenizer-Nano,这是一个约2000万参数的轻量级分词器,基于Cat(因果音频分词器与Transformer)架构构建。它支持48kHz立体声输入和输出,将音频压缩为12.5Hz的令牌流,并使用RVQ和16个码本,可变比特率从0.125 kbps到2 kbps。评估表格和图表比较了在语音、音频和音乐数据上,与不超过120M参数的开源分词器的重建质量。 还描述了更广泛的MOSS-TTS系列,包括 MOSS-TTS、MOSS-TTS-Local-Transformer、MOSS-TTSD-v1.0、MOSS-VoiceGenerator、MOSS-SoundEffect 和 MOSS-TTS-Realtime,并提供了Hugging Face和ModelScope上的模型权重链接。