这个项目能做什么
VoxCPM2 是 OpenBMB 开源的文本转语音系统,采用端到端扩散自回归架构,避免离散分词,直接生成连续语音表征。最新 2B 参数版本基于多语言语音数据训练,支持包括四川话、粤语和吴语在内的 30 种语言。
根据 README 描述,其核心功能包括:无需语言标签的多语言合成、通过自然语言描述(性别、年龄、语调、情绪、语速)设计声音、基于简短参考音频的可控语音克隆(可选风格引导),以及利用参考音频及其转录文本还原嗓音细节的「终极克隆」模式。AudioVAE V2 的非对称编解码设计接收 16kHz 参考音频,输出内置超分辨率的 48kHz 音频。
项目提供 Python API、命令行工具和 Web 演示,支持流式生成。部署方案包括用于高吞吐服务的 Nano-vLLM、支持 OpenAI 兼容 /v1/audio/speech 接口的 vLLM-Omni,以及支持在 CPU、Metal、CUDA 或 Vulkan 上运行 GGUF 权重的 llama.cpp-omni 端侧 C++ 推理方案。支持通过 SFT 和 LoRA 进行微调,权重和代码均采用 Apache-2.0 许可,可用于商业用途。
README 还列出了 Seed-TTS-eval 基准测试结果,并提示了风险与限制。本概述仅基于仓库 README,未独立验证性能声明。
评论
0 评分人数达到10人后显示
登录后参与讨论。