Sobre o projeto
Dia é um modelo de texto-para-fala de 1,6 bilhão de parâmetros criado pela Nari Labs. Ele gera diretamente diálogos altamente realistas a partir de uma transcrição, suportando múltiplos falantes por meio das tags [S1] e [S2]. O modelo pode produzir comunicações não-verbais, como risadas, tosses, suspiros e pigarros. Os usuários podem condicionar a saída com prompts de áudio para controle de emoção, tom e clonagem de voz. O projeto fornece checkpoints de modelo pré-treinados no Hugging Face, código de inferência, uma interface Gradio, CLI e integração com Transformers. Atualmente, o modelo suporta apenas geração em inglês. Resultados de benchmark em uma RTX 4090 mostram fatores em tempo real variando de x0,9 a x2,2, dependendo da precisão e compilação, com uso de VRAM entre 4,4 GB e 7,9 GB. O projeto é licenciado sob Apache 2.0 e destina-se a uso educacional e de pesquisa, com restrições contra uso indevido de identidade, conteúdo enganoso e atividades ilegais.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.