Sobre el proyecto

El proyecto está dirigido a usuarios que necesitan convertir contenido de video en imágenes para compartir en redes sociales y ofrece, en forma de Agent Skill, capacidades de selección de fotogramas, procesamiento de subtítulos, composición y control de calidad. Admite videos locales y también puede procesar mediante yt-dlp videos en línea para los que el usuario tenga derechos de uso; el modo URL puede obtener además metadatos y pistas de subtítulos, y puede emplear opcionalmente Whisper u otras capacidades de reconocimiento de voz para crear un índice temporal. El proyecto distingue dos orígenes de subtítulos: el modo nativo solo conserva los píxeles de subtítulos ya presentes en la imagen del video, sin realizar OCR, redibujado, traducción ni reescritura; el modo de guion dibuja diálogos con marcas temporales ya revisados sobre fotogramas reales del video e indica claramente que se trata de subtítulos de posproducción. Si el video solo tiene una pista de subtítulos independiente y desactivable, la Skill debe explicar primero la limitación y, tras obtener consentimiento, puede pasar al modo de guion, evitando mezclar ambos modos. El flujo completo incluye obtención de la fuente, comprobación de fotogramas reales, determinación de subtítulos incrustados o de una pista independiente, localización de la transcripción, selección de tema y frases, vuelta a los fotogramas reales para calibrar las marcas temporales, generación de manifest o lines JSON, renderizado compacto 3:4 y control de calidad visual fotograma a fotograma. El repositorio ofrece tres modalidades de trabajo: producto final local, procesamiento completo mediante URL y producción de contenido en colaboración con la Skill de selección de temas y redacción. Los scripts pueden generar una vista general de fotogramas candidatos mediante muestreo uniforme, o generar fotogramas anterior, central y posterior en torno a una marca temporal indicada; a continuación se puede previsualizar la zona de recorte de subtítulos y exportar JPG de subtítulos nativos o de subtítulos de guion. Las tareas con varias imágenes generan una vista general tipo hoja de contactos y conservan al mismo tiempo la lista de marcas temporales. El diseño adopta una norma en la que la imagen principal ocupa la mayor parte de la altura, las tiras de subtítulos son compactas y continuas y no hay espacios sobrantes entre tiras; la proporción de la imagen principal se ajusta automáticamente según el número de tiras de subtítulos. Las dependencias principales son Python 3.10+, Pillow, imageio-ffmpeg o FFmpeg del sistema; el modo URL requiere además yt-dlp y Deno o Node.js; el modo de guion necesita fuentes CJK al dibujar texto en chino, japonés o coreano. El proyecto proporciona diagnóstico de entorno de solo lectura, comprobación de versiones no bloqueante y pruebas en GitHub Actions. Cuando el modo URL encuentra un inicio de sesión de YouTube o verificación de edad, permite que yt-dlp lea temporalmente las Chrome Cookie tras la autorización explícita del usuario; la documentación indica que las Cookie no se exportan, guardan ni suben, ni se escriben en el repositorio. El código y las instrucciones de la Skill utilizan MIT License; los videos de entrada, las imágenes generadas y el contenido de terceros presente en ellas no reciben autorizaciones adicionales mediante dicha licencia.