Об этом проекте
MockingBird — это проект с открытым исходным кодом для клонирования голоса и синтеза речи, построенный на PyTorch. Он является форком Real-Time-Voice-Cloning, который поддерживал только английский язык, и расширяет его поддержкой мандаринского китайского, протестированной на нескольких наборах данных, таких как aidatatang_200zh, magicdata, aishell3 и data_aishell.
Основные возможности, описанные в README:
- Клонирование голоса и генерация речи в реальном времени, с заявленной целью клонирования голоса из короткого образца.
- Поддержка китайского мандаринского, протестированная на нескольких публичных наборах данных.
- Работает на Windows и Linux, включает инструкции по обходным путям для M1 macOS.
- Режим веб-сервера (web.py) для удаленных вызовов, GUI-инструментарий (demo_toolbox.py) и генератор командной строки (gen_voice.py).
- Конвейеры обучения для энкодера, синтезатора и вокодера, а также опции повторного использования предобученных энкодера/вокодера и моделей синтезатора, предоставленных сообществом.
- Документация по распространенным проблемам, таким как ограничения VRAM, настройка размера пакета, структура набора данных и ожидания по прогрессу обучения.
В README отмечается, что репозиторий больше не активно обновляется автором, который указывает на отдельный облачный сервис. Проект выпущен под лицензией MIT. В проекте упоминаются несколько исследовательских работ и реализаций, включая SV2TTS, GlobalStyleToken, HiFi-GAN, Fre-GAN, WaveRNN, Tacotron и GE2E.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.