Sobre o projeto

VoxCPM2 é um sistema de texto para fala de código aberto da OpenBMB que evita a tokenização discreta, gerando representações contínuas de fala por meio de uma arquitetura autoregressiva de difusão de ponta a ponta. O lançamento mais recente com 2B de parâmetros foi treinado em dados de fala multilíngues e suporta 30 idiomas, incluindo dialetos chineses como sichuanês, cantonês e wu. As principais capacidades descritas no README incluem síntese multilíngue sem tags de idioma, design de voz a partir de descrições em linguagem natural (gênero, idade, tom, emoção, ritmo), clonagem de voz controlável a partir de um clipe de referência curto com orientação de estilo opcional, e um modo de "clonagem definitiva" que usa tanto o áudio de referência quanto sua transcrição para reproduzir nuances vocais. O design assimétrico de codificação/decodificação do AudioVAE V2 aceita áudio de referência de 16 kHz e gera áudio de 48 kHz com super-resolução embutida. O projeto fornece uma API Python, uma CLI e uma demonstração web, além de geração em streaming. As opções de implantação incluem Nano-vLLM para servir com alta taxa de transferência, vLLM-Omni para um endpoint compatível com OpenAI /v1/audio/speech, e llama.cpp-omni para inferência C++ no dispositivo com pesos GGUF em CPU, Metal, CUDA ou Vulkan. O fine-tuning via SFT e LoRA é suportado. Os pesos e o código são lançados sob a licença Apache-2.0 para uso comercial. O README também lista resultados de benchmark no Seed-TTS-eval e observa riscos e limitações. Esta visão geral baseia-se exclusivamente no README do repositório e não verifica independentemente as afirmações de desempenho.