Об этом проекте
ChatTTS — это генеративная модель текста в речь, предназначенная специально для диалоговых сценариев, таких как ИИ-ассистенты. Репозиторий предоставляет алгоритмическую инфраструктуру, веса предварительно обученной модели и простые примеры для запуска инференса.
Поддерживаемые языки — английский и китайский, дополнительные языки указаны как скоро появятся. Модель обучена на китайских и английских аудиоданных, а открытая версия на HuggingFace описывается как модель с 40 000 часами предварительного обучения без SFT.
Ключевые возможности, описанные в README:
- Диалоговая ТТС, оптимизированная для задач на основе диалога, с поддержкой нескольких говорящих.
- Точный контроль над интонационными характеристиками, включая смех, паузы и вставки.
- Единицы управления на уровне токенов, такие как [laugh], [uv_break] и [lbreak], а также контроль на уровне предложений через подсказки, такие как [oral_2][laugh_0][break_6].
- Выбор говорящего из нормального распределения, с сохранением полученного вектора голоса для последующего восстановления тембра.
- Настройка параметров декодирования, включая температуру, top_P и top_K.
- Генерация потокового аудио.
Варианты начала работы включают клонирование репозитория и установку требований через pip или conda, установку пакета из PyPI или GitHub, а также запуск примера веб-интерфейса или скрипта инференса из командной строки. Пример базового использования Python загружает модель, запускает инференс на списке текстов и сохраняет выходные файлы WAV с частотой 24 кГц. Расширенные примеры охватывают выбор говорящего, контроль на уровне предложений и слов, а также пример самопрезентации.
README отмечает ожидания оборудования: не менее 4 ГБ видеопамяти для 30-секундного аудио, и на GPU 4090 RTF около 0.3. Также отмечается, что авторегрессионные модели могут демонстрировать нестабильность, такую как многоголосовой вывод или плохое качество аудио, и рекомендуется попробовать несколько образцов.
Лицензирование: код опубликован под лицензией AGPLv3+, а модель опубликована под лицензией CC BY-NC 4.0 для образовательных и исследовательских целей, не для коммерческого или незаконного использования. README указывает, что во время обучения 40-тысячной модели был добавлен небольшой объем высокочастотного шума, а качество аудио было сжато с использованием формата MP3 для ограничения потенциального злоупотребления, и планируется открытая версия внутренне обученной модели обнаружения.
Проект признает предыдущие работы, включая bark, XTTSv2, valle, fish-speech и vocos, и указывает на репозиторий сообщества, Awesome-ChatTTS, для расширенных продуктов для конечных пользователей.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.