Sobre o projeto
MOSS-TTS-Nano é um modelo de geração de fala multilíngue de código aberto da MOSI.AI e da equipe OpenMOSS. Com aproximadamente 0,1B de parâmetros, ele visa geração de fala em tempo real e pode rodar em CPU sem GPU, mantendo a implantação simples para demos locais, servidores web e integração leve.
Principais características descritas no README:
- Tamanho minúsculo do modelo de cerca de 0,1B de parâmetros.
- Saída de áudio nativa de 48 kHz e 2 canais (estéreo).
- Suporte multilíngue cobrindo 20 idiomas, incluindo chinês, inglês, alemão, espanhol, francês, japonês, italiano, húngaro, coreano, russo, persa, árabe, polonês, português, tcheco, dinamarquês, sueco, grego e turco.
- Arquitetura puramente autorregressiva construída em um pipeline de Tokenizador de Áudio mais LLM.
- Inferência em streaming com baixa latência em tempo real e primeiro áudio rápido.
- Amigável para CPU: a geração em streaming pode rodar em uma CPU de 4 núcleos.
- Capacidade de texto longo com clonagem de voz automática em partes.
- Caminhos de implantação de código aberto via scripts Python diretos e uma CLI empacotada.
Início rápido: o README recomenda um ambiente Python limpo, clonar o repositório, instalar os requisitos e instalar o projeto em modo editável para que o comando moss-tts-nano fique disponível. O carregamento padrão do modelo usa OpenMOSS-Team/MOSS-TTS-Nano e OpenMOSS-Team/MOSS-Audio-Tokenizer-Nano. A clonagem de voz é o principal fluxo de trabalho recomendado, demonstrado com infer.py usando um caminho de áudio de prompt e texto de entrada. Uma demo web FastAPI local pode ser iniciada com app.py e aberta em 127.0.0.1:18083.
Inferência ONNX em CPU: uma versão ONNX para CPU é recomendada para implantação local leve. Ela remove a dependência do PyTorch durante a inferência, roda no ONNX Runtime CPU, suporta áudio de referência direto, vozes integradas e decodificação em streaming em tempo real, e é descrita como quase 2x mais eficiente em processamento do que a versão original nos testes do projeto. Em um MacBook Air M4, foi observada inferência suave com um único núcleo de CPU. Os pontos de entrada ONNX incluem infer_onnx.py, app_onnx.py e a CLI empacotada com --backend onnx. A execução CUDA é opcional via onnxruntime-gpu e --execution-provider cuda. Arquivos de modelo ausentes são baixados na primeira execução dos repositórios ONNX no Hugging Face.
Ferramentas adicionais: um exemplo Android ONNX Runtime sob examples/android_onnx_runtime carrega gráficos ONNX exportados no dispositivo e escreve um arquivo WAV. Um exportador sob onnx/ converte um checkpoint local em formato Hugging Face em um diretório de modelo ONNX apenas para TTS. A CLI empacotada oferece comandos moss-tts-nano generate e moss-tts-nano serve, com opções para fala de prompt, arquivos de texto, seleção de backend e provedor de execução. Código e tutoriais de ajuste fino são fornecidos no diretório finetuning.
O repositório também documenta MOSS-Audio-Tokenizer-Nano, um tokenizador leve de cerca de 20 milhões de parâmetros construído na arquitetura Cat (Causal Audio Tokenizer with Transformer). Ele suporta entrada e saída estéreo de 48 kHz, comprime áudio em um fluxo de tokens de 12,5 Hz e usa RVQ com 16 codebooks em taxas de bits variáveis de 0,125 kbps a 2 kbps. Tabelas e gráficos de avaliação comparam a qualidade de reconstrução com tokenizadores de código aberto com não mais que 120M de parâmetros em dados de fala, áudio e música.
A família mais ampla MOSS-TTS também é descrita, incluindo MOSS-TTS, MOSS-TTS-Local-Transformer, MOSS-TTSD-v1.0, MOSS-VoiceGenerator, MOSS-SoundEffect e MOSS-TTS-Realtime, com links para pesos de modelos no Hugging Face e ModelScope.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.