Об этом проекте

MockingBird — это проект с открытым исходным кодом для клонирования голоса и синтеза речи, построенный на PyTorch. Он является форком Real-Time-Voice-Cloning, который поддерживал только английский язык, и расширяет его поддержкой мандаринского китайского, протестированной на нескольких наборах данных, таких как aidatatang_200zh, magicdata, aishell3 и data_aishell. Основные возможности, описанные в README: - Клонирование голоса и генерация речи в реальном времени, с заявленной целью клонирования голоса из короткого образца. - Поддержка китайского мандаринского, протестированная на нескольких публичных наборах данных. - Работает на Windows и Linux, включает инструкции по обходным путям для M1 macOS. - Режим веб-сервера (web.py) для удаленных вызовов, GUI-инструментарий (demo_toolbox.py) и генератор командной строки (gen_voice.py). - Конвейеры обучения для энкодера, синтезатора и вокодера, а также опции повторного использования предобученных энкодера/вокодера и моделей синтезатора, предоставленных сообществом. - Документация по распространенным проблемам, таким как ограничения VRAM, настройка размера пакета, структура набора данных и ожидания по прогрессу обучения. В README отмечается, что репозиторий больше не активно обновляется автором, который указывает на отдельный облачный сервис. Проект выпущен под лицензией MIT. В проекте упоминаются несколько исследовательских работ и реализаций, включая SV2TTS, GlobalStyleToken, HiFi-GAN, Fre-GAN, WaveRNN, Tacotron и GE2E.