vtmate es un kit de herramientas de IA de voz basado en terminal, con latencia ultrabaja, soporte para 41 idiomas y TTS/STT integrados. Permite conversaciones de voz en vivo, debates, clonación de voz, exportación de sesiones y modo daemon en segundo plano con atajos globales para una interacción fluida con la IA.
Código abierto. Nuevas posibilidades.
Descubre proyectos de código abierto de calidad, envía proyectos de forma anónima y reclama y edita tu propio proyecto.
Un poco de curiosidad. Un mundo de código abierto.
THE FIRST COLLECTIONOpenCreator es un espacio de trabajo IA de código abierto que integra creación de contenido multimodal y un agente general en un entorno local basado en Codex CLI.
Unsloth es una aplicación de escritorio y un framework para ejecutar y entrenar modelos de lenguaje extensos (LLMs) y modelos de difusión localmente en Windows, macOS y Linux.
Verba es una aplicación de escritorio offline-first para aprender idiomas conversando con un entrenador de IA. Ejecuta modelos localmente con Ollama o tu propia clave, con correcciones en línea, lectura graduada, repetición espaciada y síntesis de voz integrada.
Una extensión de navegador para Google Chrome y Mozilla Firefox que proporciona traducción de subtítulos en tiempo real y en dos idiomas para los videos de YouTube.
LocalAI es un motor de inferencia de IA de código abierto y autoalojado que ejecuta modelos de lenguaje, visión, voz, imagen y video en cualquier hardware, incluido sin GPU. Ofrece compatibilidad con APIs de OpenAI, Anthropic y ElevenLabs, backends modulares bajo demanda, autenticación multiusuario y agentes integrados con RAG y MCP.
VoxCPM2 es un sistema de texto a voz sin tokenizador con un modelo autoregresivo de difusión de 2B que soporta 30 idiomas, diseño de voz a partir de descripciones de texto, clonación de voz controlable y salida de audio de 48 kHz.
Pixelle-Video es un motor de IA de código abierto para la generación automática de videos cortos. Los usuarios solo necesitan introducir un tema para que el sistema genere automáticamente guiones, imágenes o clips, narración de voz, música de fondo y el video final, sin necesidad de experiencia en edición.
Un curso de Python basado en terminal: escribes código real en un editor modal estilo Neovim mientras una voz TTS local te guía, sin conexión. Incluye ejercicios, una ruta de cloud/DevOps simulada y progreso guardado.
ChatTTS es un modelo de síntesis de voz de código abierto diseñado para escenarios de diálogo, soportando inglés y chino con salida de múltiples hablantes y control detallado sobre risas, pausas y prosodia.
GPT-SoVITS es un sistema de conversión de voz y TTS con pocos ejemplos que soporta clonación de voz zero-shot (5s) y few-shot (1min) en chino, japonés, coreano, cantonés e inglés. Incluye herramientas WebUI para separación de audio, ASR y preparación de datasets.
Herramienta open-source para traducción de videos, transcripción de audio, doblaje con IA y traducción de subtítulos, con soporte local y APIs en línea.
NVIDIA NeMo Speech es un marco de trabajo PyTorch bajo licencia Apache-2.0 para construir, personalizar y desplegar modelos de IA de voz, que cubre reconocimiento automático del habla, texto a voz y LLMs de voz, con puntos de control preentrenados y rutas de instalación mediante Docker/uv.
FunTTS es una biblioteca de texto a voz con una interfaz unificada que permite cambiar sin problemas entre múltiples motores de TTS, ofreciendo generación de subtítulos, diálogos multi-rol y procesamiento asíncrono.