Sobre el proyecto

MOSS-TTS Family ofrece cinco modelos listos para producción para diversas tareas de generación de audio. MOSS-TTS (el modelo insignia) ofrece clonación de voz zero-shot de alta fidelidad con estabilidad en formato largo, control de duración a nivel de token, control de pronunciación en Pinyin/IPA y síntesis multilingüe con alternancia de idiomas. MOSS-TTSD se especializa en la generación expresiva de diálogos multihablante para podcasts y doblaje. MOSS-VoiceGenerator crea voces y estilos diversos a partir de prompts de texto sin necesidad de voz de referencia. MOSS-TTS-Realtime permite streaming de baja latencia para agentes de voz con un TTFB de 180 ms. MOSS-SoundEffect genera sonidos ambientales, escenas urbanas, sonidos biológicos y fragmentos musicales de hasta 30 segundos a 48 kHz. Dos arquitecturas principales: MossTTSDelay (RVQ paralelo multi-cabeza con programación de patrón de retardo) hace hincapié en la estabilidad de contexto largo y la preparación para producción; MossTTSLocal (bloques RVQ sincronizados en el tiempo con transformer de profundidad) hace hincapié en la flexibilidad ligera para streaming. MossTTSRealtime añade modelado jerárquico de texto-audio para conciencia de contexto en múltiples turnos. Los checkpoints publicados van desde 1.7B hasta 8B de parámetros, y las actualizaciones v1.5 añaden una síntesis multilingüe más sólida mediante etiquetas de idioma, clonación de voz más estable, mejor manejo de textos cortos con referencias largas, prosodia que sigue la puntuación y control explícito de pausas mediante marcadores `[pause X.Ys]`. MOSS-TTS-Local-Transformer-v1.5 utiliza MOSS-Audio-Tokenizer-v2 para una salida estéreo nativa de 48 kHz. Los backends de inferencia incluyen SGLang-Omni (soporte desde el día 0 para MossTTSLocal), vLLM-Omni (soporte para toda la serie) y llama.cpp con ONNX Runtime para despliegue sin PyTorch (pesos GGUF disponibles). Los tutoriales de fine-tuning cubren las arquitecturas MossTTSDelay, MossTTSLocal y MossTTSRealtime. Los modelos están alojados en Hugging Face y ModelScope con endpoints de API compatibles con OpenAI a través de SGLang.