Об этом проекте

Real-Time Voice Cloning — это реализация статьи «Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis» (SV2TTS), изначально разработанная как магистерская диссертация. Она клонирует голос по нескольким секундам аудио, а затем генерирует произвольную речь в реальном времени. SV2TTS — это трёхэтапная система глубокого обучения. На первом этапе по нескольким секундам аудио создаётся цифровое представление голоса (кодировщик говорящего на основе GE2E). На втором и третьем этапах это представление используется как ориентир для синтеза речи по произвольному тексту с помощью синтезатора на основе Tacotron и вокодера WaveRNN. Репозиторий реализует SV2TTS и сам кодировщик GE2E, а также опирается на fatchord/WaveRNN для компонентов вокодера и синтезатора. Проект предоставляет набор инструментов как с графическим интерфейсом (demo_toolbox.py), так и с интерфейсом командной строки (demo_cli.py). Поддерживаются Windows и Linux. Для настройки требуются ffmpeg для чтения аудиофайлов и uv для управления пакетами Python; набор инструментов можно запускать либо с расширением CUDA для видеокарт NVIDIA, либо с расширением CPU. Предобученные модели загружаются автоматически, также доступна ручная загрузка с Hugging Face. Для экспериментов можно использовать дополнительные наборы данных, например LibriSpeech train-clean-100, хотя пользователи могут вместо этого предоставить собственные аудиофайлы или записать звук прямо в наборе инструментов. В README отмечается, что репозиторий устарел и что многие платные SaaS-сервисы теперь предлагают лучшее качество звука. Читателям рекомендуют Papers with Code для ознакомления с последними исследованиями по синтезу речи и Chatterbox как более современную альтернативу с открытым исходным кодом.