このプロジェクトについて

VibeVoiceはMicrosoftによるオープンソースの音声AIプロジェクトであり、Automatic Speech Recognition(ASR)およびText-to-Speech(TTS)モデルを含みます。中核的な技術的特徴は、超低フレームレート7.5 Hzで動作する連続音声トークナイザーを用い、長時間シーケンスの計算効率を高めながらオーディオ忠実性を保持すること、ならびにnext-token拡散フレームワークを組み合わせている点です。 リポジトリに記載された主要モデルと機能: 1. VibeVoice-ASR:60分間の連続音声をワンパスで処理する統一型音声からテキストへの変換モデル。話者ID(Who)、タイムスタンプ(When)、内容(What)を含む構造化された文字起こしを出力します。ドメイン固有用語用のユーザーカスタムホットワードに対応し、50以上の言語をネイティブにサポートする多言語モデルです。ストリーミング版は到着する音声を書き起こします。Hugging Face TransformersおよびvLLM推論に対応しています。 2. VibeVoice-ASR-BitNet:ヘテロジニアス量子化(I8_S + I2_S)を使用するエッジCPU推論エンジン。モデルを4.62 GBから1.58 GBに圧縮し、GPUなしでCPUスレッド上でリアルタイム推論を実現します。 3. VibeVoice-TTS:最大90分間の音声をワンパスで、最大4名の異なる話者で合成できる長時間対応マルチ話者TTSモデル。英語と中国語を含む複数言語、および表現豊かな音声をサポートします。なお、TTSコードは誤用事例を受けて責任あるAIの観点からリポジトリから削除されました。 4. VibeVoice-Realtime-0.5B:0.5Bパラメータの軽量リアルタイムストリーミングTTSモデルです。ストリーミングテキスト入力と堅牢な長時間音声生成をサポートし、実験的な多言語音声も備えます。 リポジトリにはドキュメント、ASRのファインチューニングコード、デモ、Hugging Face上のモデルウェイトへのリンクが含まれます。本プロジェクトは研究開発目的を意図しており、さらにテストを行わない商業利用や実世界への適用は推奨されません。