Об этом проекте

ChatTTS — это генеративная модель текста в речь, предназначенная специально для диалоговых сценариев, таких как ИИ-ассистенты. Репозиторий предоставляет алгоритмическую инфраструктуру, веса предварительно обученной модели и простые примеры для запуска инференса. Поддерживаемые языки — английский и китайский, дополнительные языки указаны как скоро появятся. Модель обучена на китайских и английских аудиоданных, а открытая версия на HuggingFace описывается как модель с 40 000 часами предварительного обучения без SFT. Ключевые возможности, описанные в README: - Диалоговая ТТС, оптимизированная для задач на основе диалога, с поддержкой нескольких говорящих. - Точный контроль над интонационными характеристиками, включая смех, паузы и вставки. - Единицы управления на уровне токенов, такие как [laugh], [uv_break] и [lbreak], а также контроль на уровне предложений через подсказки, такие как [oral_2][laugh_0][break_6]. - Выбор говорящего из нормального распределения, с сохранением полученного вектора голоса для последующего восстановления тембра. - Настройка параметров декодирования, включая температуру, top_P и top_K. - Генерация потокового аудио. Варианты начала работы включают клонирование репозитория и установку требований через pip или conda, установку пакета из PyPI или GitHub, а также запуск примера веб-интерфейса или скрипта инференса из командной строки. Пример базового использования Python загружает модель, запускает инференс на списке текстов и сохраняет выходные файлы WAV с частотой 24 кГц. Расширенные примеры охватывают выбор говорящего, контроль на уровне предложений и слов, а также пример самопрезентации. README отмечает ожидания оборудования: не менее 4 ГБ видеопамяти для 30-секундного аудио, и на GPU 4090 RTF около 0.3. Также отмечается, что авторегрессионные модели могут демонстрировать нестабильность, такую как многоголосовой вывод или плохое качество аудио, и рекомендуется попробовать несколько образцов. Лицензирование: код опубликован под лицензией AGPLv3+, а модель опубликована под лицензией CC BY-NC 4.0 для образовательных и исследовательских целей, не для коммерческого или незаконного использования. README указывает, что во время обучения 40-тысячной модели был добавлен небольшой объем высокочастотного шума, а качество аудио было сжато с использованием формата MP3 для ограничения потенциального злоупотребления, и планируется открытая версия внутренне обученной модели обнаружения. Проект признает предыдущие работы, включая bark, XTTSv2, valle, fish-speech и vocos, и указывает на репозиторий сообщества, Awesome-ChatTTS, для расширенных продуктов для конечных пользователей.