Sobre el proyecto

video-use es un proyecto de código abierto que permite la edición de vídeo mediante agentes de programación como Claude Code, Codex o Hermes. Los usuarios depositan el material en bruto en una carpeta, chatean con el agente y reciben un archivo final.mp4 terminado. Funciona con todo tipo de contenido, como vídeos de personas hablando, montajes, tutoriales, vídeos de viajes y entrevistas, sin necesidad de ajustes preestablecidos ni menús. Entre sus capacidades principales se incluyen: - Eliminación de palabras de relleno (umm, uh, inicios falsos) y espacios muertos entre tomas - Corrección de color automática con estilos cinematográficos cálidos, tonos neutros intensos o cadenas ffmpeg personalizadas - Fundidos de audio de 30 ms en cada corte para evitar ruidos molestos en el audio - Inserción de subtítulos con estilos personalizables (por defecto, fragmentos de 2 palabras en mayúsculas) - Generación de superposiciones de animación mediante HyperFrames, Remotion, Manim o PIL, lanzadas en subagentes paralelos - Autoevaluación del resultado renderizado en cada límite de corte antes de mostrar los resultados - Almacenamiento de la memoria de la sesión en project.md para mantener la continuidad entre sesiones El sistema funciona haciendo que el LLM lea el vídeo a través de dos capas en lugar de verlo directamente. La capa 1 es una transcripción de audio de ElevenLabs Scribe que proporciona marcas de tiempo a nivel de palabra, diarización de hablantes y eventos de audio, empaquetada en un archivo de texto de aproximadamente 12 KB. La capa 2 es un compositor visual bajo demanda (película de fotogramas + forma de onda + etiquetas de palabras en PNG) generado solo en puntos de decisión. Este enfoque evita procesar millones de tokens de fotogramas en bruto. El flujo de la canalización es: Transcribir -> Empaquetar -> El LLM razona -> EDL -> Renderizar -> Autoevaluar, con un bucle de autoevaluación que comprueba el resultado renderizado en los límites de corte y puede solucionar problemas hasta 3 veces antes de mostrar la vista previa. La configuración se puede realizar mediante un prompt listo para pegar para la instalación automatizada, o manualmente clonando el repositorio, instalando dependencias (uv/pip, ffmpeg, yt-dlp) y añadiendo una clave de API de ElevenLabs. Los principios de diseño hacen hincapié en el texto y los visuales bajo demanda, el audio como elemento principal con los visuales como complemento, la aprobación de la estrategia antes de la ejecución, cero suposiciones sobre el contenido, 12 reglas de producción estrictas y libertad artística en el resto de aspectos.