Sobre o projeto

ChatTTS é um modelo de síntese de texto para fala gerativo projetado especificamente para cenários de diálogo, como assistentes de LLM. O repositório fornece a infraestrutura algorítmica, pesos do modelo pré-treinado e exemplos simples para execução de inferência. Idiomas suportados são inglês e chinês, com outros idiomas listados como próximos. O modelo foi treinado em dados de áudio chinês e inglês, e a versão de código aberto no HuggingFace é descrita como um modelo pré-treinado de 40.000 horas sem SFT. Capacidades principais descritas no README: - TTS conversacional otimizado para tarefas baseadas em diálogo, com suporte a múltiplos falantes. - Controle fino sobre características prosódicas, incluindo risos, pausas e interjeições. - Unidades de controle a nível de token, como [laugh], [uv_break] e [lbreak], além de controle a nível de frase via prompts como [oral_2][laugh_0][break_6]. - Amostragem de falantes a partir de uma distribuição gaussiana, com a embutimento do falante amostrado salvo para recuperação de timbre posterior. - Parâmetros de decodificação ajustáveis, incluindo temperatura, top_P e top_K. - Geração de áudio em streaming. Opções para começar incluem clonar o repositório e instalar os requisitos via pip ou conda, instalar o pacote do PyPI ou GitHub, e executar um exemplo de WebUI ou um script de inferência por linha de comando. Um exemplo básico de uso em Python carrega o modelo, executa a inferência em uma lista de textos e salva arquivos WAV de saída a 24 kHz. Exemplos avançados cobrem amostragem de falantes, controle a nível de frase e palavra, e uma amostra de autoapresentação. O README observa as expectativas de hardware: pelo menos 4GB de memória de GPU para um trecho de 30 segundos, e em uma GPU 4090 um RTF de cerca de 0,3. Também observa que modelos autoregressivos podem mostrar instabilidade, como saída de múltiplos falantes ou má qualidade de áudio, e sugere tentar múltiplas amostras. Licenciamento: o código é publicado sob AGPLv3+, enquanto o modelo é publicado sob CC BY-NC 4.0 para uso educacional e de pesquisa, não para fins comerciais ou ilegais. O README afirma que um pequeno ruído de alta frequência foi adicionado durante o treinamento do modelo de 40.000 horas e a qualidade de áudio foi comprimida usando formato MP3 para limitar o uso inadequado, e que um modelo de detecção internamente treinado está planejado para liberação open-source. O projeto reconhece trabalhos anteriores, incluindo bark, XTTSv2, valle, fish-speech e vocos, e aponta para um repositório mantido pela comunidade, Awesome-ChatTTS, para produtos finais estendidos.