Об этом проекте
Dia — это модель преобразования текста в речь с 1,6 миллиарда параметров, созданная Nari Labs. Она напрямую генерирует высокореалистичные диалоги из транскрипции, поддерживая несколько говорящих с помощью тегов [S1] и [S2]. Модель может воспроизводить невербальные коммуникации, такие как смех, кашель, вздохи и прочищение горла. Пользователи могут задавать условия вывода с помощью аудиоподсказок для контроля эмоций, тона и клонирования голоса. Проект предоставляет контрольные точки предварительно обученной модели на Hugging Face, код для вывода, интерфейс Gradio, CLI и интеграцию с Transformers. В настоящее время модель поддерживает генерацию только на английском языке. Результаты бенчмарков на RTX 4090 показывают коэффициенты реального времени от x0,9 до x2,2 в зависимости от точности и компиляции, при этом использование VRAM составляет от 4,4 ГБ до 7,9 ГБ. Проект лицензирован под Apache 2.0 и предназначен для исследовательских и образовательных целей с ограничениями на неправомерное использование личности, создание обманчивого контента и незаконную деятельность.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.