ChatMonteur es un editor de video AI orquestado por agentes para grabaciones de busto parlante. Transcribe, corta por significado, añade subtítulos, gráficos, sonido y color, impulsado por Claude Code o Codex. Incluye dos puertas de calidad para rechazar planes débiles y archivos dañados. Gratuito y local por defecto.
Código abierto. Nuevas posibilidades.
Descubre proyectos de código abierto de calidad, envía proyectos de forma anónima y reclama y edita tu propio proyecto.
Un poco de curiosidad. Un mundo de código abierto.
THE FIRST COLLECTIONUna herramienta de Python que localiza videos de YouTube con licencia añadiendo subtítulos duros en chino y ayuda a publicarlos en B站, compatible con transcripción de voz, reconocimiento OCR, traducción mediante LLM y renderizado de subtítulos duros.
Voicebox es un estudio de voz de IA de código abierto y ejecución local que clona voces, genera voz, ofrece dictado global y permite que agentes de IA hablen mediante herramientas MCP.
Magnetic es un editor de video no lineal gratuito y de código abierto para Windows que presenta una línea de tiempo magnética y herramientas de edición asistidas por IA.
Verba es una aplicación de escritorio offline-first para aprender idiomas conversando con un entrenador de IA. Ejecuta modelos localmente con Ollama o tu propia clave, con correcciones en línea, lectura graduada, repetición espaciada y síntesis de voz integrada.
Un ejecutor de automatización que mantiene actualizado el ejecutable de Windows publicado por el paquete complementario Soenneker.Libraries.Whisper.CTranslate, impulsado por flujos de trabajo de GitHub Actions programados y bajo demanda.
LearnNote es un asistente de aprendizaje con IA priorizando el almacenamiento local que genera notas estructuradas a partir de videos de Bilibili, YouTube, archivos locales y PDF, permitiendo leer, editar y exportar desde un panel web.
Una implementación de C/C++ de alto rendimiento para la inferencia del modelo de reconocimiento automático de voz (ASR) Whisper de OpenAI, diseñada para un despliegue ligero y multiplataforma.
SkyClass Distill es una herramienta de flujo de trabajo que transforma videos educativos en habilidades de enseñanza (Teaching Skills) estructuradas, admitiendo la captura de video, transcripción, extracción de evidencia y destilación mediante LLM.
Xinference es una biblioteca unificada de inferencia para servir modelos de lenguaje, voz y multimodales. Proporciona API RESTful compatible con OpenAI, utilización heterogénea de GPU/CPU, despliegue distribuido e integraciones con LangChain, LlamaIndex, Dify y Chatbox.
Un editor de subtítulos basado en el navegador con carriles por hablante que optimiza el proceso desde la transcripción hasta la corrección y exportación.
by2kb convierte URLs de videos de plataformas como Bilibili y YouTube en artefactos de base de conocimiento Markdown duraderos, incluyendo transcripciones, resúmenes y notas de estudio, con soporte para flujos de trabajo centrados en agentes y ASR local o en la nube.
Una herramienta de edición automática de video impulsada por IA que utiliza Whisper y Gemini, compatible con tailandés e inglés, con corte de segmentos clave y subtitulado, 3-4 veces más rápida mediante GPU y Docker.
Una reimplementación rápida del modelo Whisper de OpenAI utilizando CTranslate2, que ofrece una mayor velocidad de transcripción y un menor uso de memoria.
Tandem es un servidor auto-alojado con clientes web y Android que mantiene una posición de lectura única entre un libro electrónico y su audiolibro. Transcribe el audio con Whisper, alinea el texto con el EPUB frase por frase y almacena el progreso en el servidor.
LazyEdit es un flujo de trabajo de video asistido por IA y local-first para la creación, procesamiento y publicación opcional de contenido de extremo a extremo.
WhisperLiveKit (WLK) es un sistema de voz a texto de código abierto y autoalojado diseñado para transcripción en tiempo real de ultra baja latencia. Soporta múltiples modelos y provides APIs compatibles con OpenAI y Deepgram.