GPT-SoVITS es un sistema de conversión de voz y TTS con pocos ejemplos que soporta clonación de voz zero-shot (5s) y few-shot (1min) en chino, japonés, coreano, cantonés e inglés. Incluye herramientas WebUI para separación de audio, ASR y preparación de datasets.
Código abierto. Nuevas posibilidades.
Descubre proyectos de código abierto de calidad, envía proyectos de forma anónima y reclama y edita tu propio proyecto.
Un poco de curiosidad. Un mundo de código abierto.
THE FIRST COLLECTIONHerramienta open-source para traducción de videos, transcripción de audio, doblaje con IA y traducción de subtítulos, con soporte local y APIs en línea.
Un plugin de LLM multimodal local para Unreal Engine 5 que proporciona inferencia offline para texto, speech-to-text y text-to-speech.
FunTTS es una biblioteca de texto a voz con una interfaz unificada que permite cambiar sin problemas entre múltiples motores de TTS, ofreciendo generación de subtítulos, diálogos multi-rol y procesamiento asíncrono.
MoneyPrinterTurbo es una herramienta integral de generación de videos cortos con IA: basta con introducir un tema o palabra clave para que complete automáticamente guion, voz en off, material, subtítulos, música y edición, y genere video HD en 9:16, 16:9 y 1:1, con cuatro modos de uso: WebUI, API, CLI y AI Agent.
Mimora is a free, fully local pronunciation trainer for English and Spanish. It uses on-device TTS, speech recognition, and a local LLM to generate phrases and score user attempts with word-level feedback, requiring no cloud or API keys.
Unsloth es una aplicación de escritorio y un framework para ejecutar y entrenar modelos de lenguaje extensos (LLMs) y modelos de difusión localmente en Windows, macOS y Linux.
Zara es un asistente de IA experimental local-first y copilot de escritorio Linux que combina lógica simbólica (Prolog) con LLMs para el manejo de intenciones y el razonamiento.
VoxCPM2 es un sistema de texto a voz sin tokenizador con un modelo autoregresivo de difusión de 2B que soporta 30 idiomas, diseño de voz a partir de descripciones de texto, clonación de voz controlable y salida de audio de 48 kHz.
Un servidor MCP diseñado para enseñar musicalidad a la IA mediante piano y guitarra. Cuenta con 120 canciones anotadas, seis motores de sonido, un cockpit de composición basado en navegador y un conjunto de datos público de trazas de uso de herramientas.
Velo AI Studio es una herramienta de creación de videos de código abierto basada en el navegador diseñada para ensamblar videos narrados a partir de guiones, audio y recursos visuales generados por IA.
TaleWeaver es un motor de aventuras de texto con IA autohospedado y basado en navegador, con un director de juego de IA, editor de aventuras, mecánicas de RPG, narración por voz/entrada de voz y despliegue con Docker/SQLite.
OpenMontage es un sistema de producción de video agéntico de código abierto que transforma los asistentes de codificación de IA en estudios de video completos, soportando flujos de trabajo integrales desde la investigación hasta el renderizado final.
ChatTTS es un modelo de síntesis de voz de código abierto diseñado para escenarios de diálogo, soportando inglés y chino con salida de múltiples hablantes y control detallado sobre risas, pausas y prosodia.