このプロジェクトについて
MockingBirdは、PyTorch上に構築されたオープンソースの音声クローニングおよびテキスト読み上げプロジェクトです。英語のみをサポートしていたReal-Time-Voice-Cloningのフォークであり、aidatatang_200zh、magicdata、aishell3、data_aishellなどの複数のデータセットでテストされた中国語(標準中国語)サポートを追加しています。
READMEに記載されている主な機能:
- リアルタイムでの音声クローニングと音声生成。短いサンプルから音声をクローニングすることを目標として掲げています。
- 中国語(標準中国語)のサポート。複数の公開データセットでテスト済みです。
- WindowsとLinuxで動作し、M1 macOS向けの回避策の手順も含まれています。
- リモート呼び出し用のWebサーバーモード(web.py)、GUIツールボックス(demo_toolbox.py)、コマンドライン生成ツール(gen_voice.py)。
- エンコーダ、シンセサイザ、ボコーダのトレーニングパイプラインに加え、事前学習済みのエンコーダ/ボコーダやコミュニティ共有のシンセサイザモデルを再利用するオプション。
- VRAMの制限、バッチサイズの調整、データセットのレイアウト、トレーニングの進捗に関する期待値など、よくある問題のドキュメント。
READMEには、このリポジトリは作者によってもはや活発に更新されておらず、別のクラウドホスト型サービスを案内していることが記載されています。MITライセンスの下で公開されています。このプロジェクトは、SV2TTS、GlobalStyleToken、HiFi-GAN、Fre-GAN、WaveRNN、Tacotron、GE2Eなど、いくつかの研究論文と実装を参照しています。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.