このプロジェクトについて
Real-Time Voice Cloningは、論文「Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis」(SV2TTS)の実装であり、もともとは修士論文として開発された。数秒の音声から声をクローンし、その後、任意の音声をリアルタイムで生成する。
SV2TTSは3段階の深層学習フレームワークである。第1段階では、数秒の音声から声のデジタル表現(GE2Eベースの話者エンコーダ)を作成する。第2段階と第3段階では、その表現を参照として使用し、TacotronベースのシンセサイザーとWaveRNNボコーダを用いて任意のテキストの音声を合成する。このリポジトリはSV2TTSとGE2Eエンコーダ自体を実装しており、ボコーダとシンセサイザーのコンポーネントについてはfatchord/WaveRNNを基に構築されている。
このプロジェクトは、GUI(demo_toolbox.py)とコマンドラインインターフェース(demo_cli.py)の両方を備えたツールボックスを提供する。WindowsとLinuxをサポートしている。セットアップには音声ファイルを読み取るためのffmpegと、Pythonパッケージ管理のためのuvが必要であり、ツールボックスはNVIDIA GPU用のCUDA extraまたはCPU extraのいずれかで実行できる。事前学習済みモデルは自動的にダウンロードされ、Hugging Faceから手動でダウンロードすることも可能である。LibriSpeech train-clean-100などのオプションのデータセットを実験に使用できるが、ユーザーは代わりに独自の音声ファイルを用意したり、ツールボックス内で直接録音したりすることもできる。
READMEには、このリポジトリが古くなっており、現在では多くの有料SaaSサービスがより良い音質を提供していると記されている。最近の音声合成研究についてはPapers with Codeを、より新しいオープンソースの代替としてはChatterboxを参照するよう読者に案内している。
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.