このプロジェクトについて

VoxCPM2は、OpenBMBによるオープンソースのテキスト読み上げシステムで、離散的トークン化を避け、エンドツーエンドの拡散自己回帰アーキテクチャを通じて連続した音声表現を生成します。 最新の2Bパラメータリリースは、多言語音声データで訓練され、四川語、広東語、呉語などの中国方言を含む30言語をサポートします。 READMEに記載されている主な機能には、言語タグ不要の多言語合成、自然言語による説明(性別、年齢、トーン、感情、ペース)からの音声デザイン、オプションのスタイルガイド付き短い参照クリップからの制御可能な音声クローン、および参照音声とその転写の両方を使用して声のニュアンスを再現する「究極のクローン」モードがあります。AudioVAE V2の非対称エンコード/デコード設計は、16kHzの参照音声を受け入れ、組み込みのスーパーレゾリューションにより48kHzの音声を出力します。 このプロジェクトは、Python API、CLI、ウェブデモを提供し、ストリーミング生成にも対応しています。デプロイメントオプションには、高スループットサービス向けのNano-vLLM、OpenAI互換の/v1/audio/speechエンドポイント向けのvLLM-Omni、CPU、Metal、CUDA、VulkanでのGGUFウェイトによるオンデバイスC++推論向けのllama.cpp-omniがあります。SFTおよびLoRAによるファインチューニングがサポートされています。ウェイトとコードは商用利用可能なApache-2.0ライセンスでリリースされています。 READMEには、Seed-TTS-evalにおけるベンチマーク結果も掲載されており、リスクと制限事項も記載されています。この概要はリポジトリのREADMEに基づくものであり、パフォーマンス主張の独立した検証は行われていません。