Sobre el proyecto

ChatMonteur es un estudio de edición extensible y orquestado por agentes para grabaciones reales de busto parlante, como vlogs, tutoriales y videos explicativos. No genera video desde cero; edita material bruto existente a través de un pipeline que orquestra herramientas de código abierto establecidas: auto-editor, faster-whisper, HyperFrames y ffmpeg. El sistema es impulsado por un agente de codificación (Claude Code, Codex o similar). El usuario introduce el material bruto y describe la edición deseada en lenguaje sencillo. Luego, el agente ejecuta el pipeline, que transcribe el audio, corta pausas y tropiezos basándose en el significado, genera subtítulos, añade gráficos en movimiento, sonido y gradación de color, y renderiza el archivo final. Se aplican dos puertas de calidad durante todo el flujo de trabajo. La puerta de plan califica el plan visual antes de que se renderice cualquier fotograma y rechaza los resultados que se lean como cortes mecánicos; por ejemplo, tramos de más de 90 segundos sin eventos visuales, texto en pantalla durante más del 60 por ciento del tiempo de ejecución, subtítulos repetidos o tres zooms idénticos seguidos. La puerta de archivo vuelve a abrir cada artefacto codificado en marcas de tiempo muestreadas (10, 35, 65 y 90 por ciento), verifica los niveles de audio para detectar silencios y saturación, y compara el tiempo de ejecución con lo que se le entregó al codificador. Cualquier archivo dañado detiene la entrega y produce un informe hermano `.qc.json`. El conocimiento de las decisiones editoriales reside en el directorio `skills/`, escrito como una base de conocimientos auditable en lugar de prompts embebidos. Esto incluye orientación sobre dónde cortar, cómo rellenar los cortes, cuándo hacer zoom y cómo equilibrar la cama musical. Todos los umbrales de ingeniería están documentados en `engineering-facts.md` con explicaciones de por qué se mantiene cada regla. Un flujo de trabajo típico produce un borrador mecánicamente válido con un solo comando, tras lo cual el usuario habla con el agente para finalizar la edición: eliminando rellenos, añadiendo subtítulos y gráficos, y refinando el sonido. El agente presenta las puertas de aprobación requeridas y promueve solo las ediciones completadas a un archivo maestro. El proyecto es gratuito y prioriza el entorno local. `faster-whisper` se ejecuta localmente sin claves de API pagas. Se pueden añadir backends de transcripción adicionales como plugins. La codificación multiplataforma es compatible con fallback de NVENC a libx64, VideoToolbox o QSV. El estado es v0.1. El pipeline mecánico funciona de extremo a extremo, y el flujo de trabajo impulsado por el agente ha sido probado en la edición de un canal de YouTube completo, desde el material bruto hasta un maestro verificado.