这个项目能做什么

VibeVoice是微软推出的开源语音AI项目,包含自动语音识别(ASR)和文本转语音(TTS)模型。其核心技术特征是采用连续语音分词器,以7.5 Hz的超低帧率运行,在保持音频保真度的同时提升长序列的计算效率,并结合下一词扩散框架。 仓库中记录的主要模型及功能如下: 1. VibeVoice-ASR:一款统一的语音转文字模型,单次可处理长达60分钟的连续音频。输出包含说话人身份(Who)、时间戳(When)和内容(What)的结构化转录文本。支持用户自定义热词以适应领域术语,原生支持50多种语言的多语言处理。还提供流式变体,可在音频到达时实时转录。已集成至Hugging Face Transformers,并支持vLLM推理。 2. VibeVoice-ASR-BitNet:一种边缘CPU推理引擎,采用异构量化(I8_S + I2_S),将模型从4.62 GB压缩至1.58 GB,可在CPU线程上实现无需GPU的实时推理。 3. VibeVoice-TTS:一款长篇幅多说话人文本转语音模型,单次可合成最多90分钟的语音,支持多达4个不同说话人。支持富有表现力的语音及英语和中文等多种语言。注意:由于负责任AI方面的担忧以及在滥用事件后,TTS代码已从仓库中移除。 4. VibeVoice-Realtime-0.5B:一款轻量级(0.5B参数)实时流式TTS模型,支持流式文本输入和稳健的长篇幅语音生成,具备实验性多语言语音。 该仓库包含文档、ASR微调代码、演示以及Hugging Face上的模型权重链接。项目声明仅用于研发目的,未经进一步测试不建议用于商业或实际应用场景。