Sobre el proyecto
VoxCPM2 es un sistema de texto a voz de código abierto de OpenBMB que evita la tokenización discreta, generando representaciones continuas de habla mediante una arquitectura autoregresiva de difusión de extremo a extremo. La última versión de 2B de parámetros está entrenada con datos de habla multilingüe y soporta 30 idiomas, incluidos dialectos chinos como el sichuanés, cantonés y wu.
Las capacidades clave descritas en el README incluyen síntesis multilingüe sin etiquetas de idioma, diseño de voz a partir de descripciones en lenguaje natural (género, edad, tono, emoción, ritmo), clonación de voz controlable a partir de un clip de referencia breve con guía de estilo opcional, y un modo de "clonación definitiva" que utiliza tanto el audio de referencia como su transcripción para reproducir matices vocales. El diseño asimétrico de codificación/decodificación de AudioVAE V2 acepta audio de referencia de 16 kHz y produce audio de 48 kHz con superresolución incorporada.
El proyecto proporciona una API de Python, una CLI y una demostración web, además de generación por streaming. Las opciones de despliegue incluyen Nano-vLLM para servicio de alto rendimiento, vLLM-Omni para un endpoint compatible con OpenAI /v1/audio/speech, y llama.cpp-omni para inferencia en dispositivo C++ con pesos GGUF en CPU, Metal, CUDA o Vulkan. El fine-tuning mediante SFT y LoRA está soportado. Los pesos y el código se publican bajo la licencia Apache-2.0 para uso comercial.
El README también enumera resultados de referencia en Seed-TTS-eval y menciona riesgos y limitaciones. Esta visión general se basa únicamente en el README del repositorio y no verifica independientemente las afirmaciones de rendimiento.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.