Sobre o projeto

Este projeto se destina a usuários que precisam organizar conteúdo de vídeo em imagens para compartilhamento social e, na forma de um Agent Skill, oferece seleção de quadros, processamento de legendas, montagem e controle de qualidade. Ele suporta vídeos locais e também pode processar, por meio do yt-dlp, vídeos on-line que o usuário tenha direito de usar; o modo URL também pode obter metadados e faixas de legendas e, opcionalmente, usar Whisper ou outros recursos de reconhecimento de fala para criar um índice temporal. O projeto distingue duas origens de legenda: o modo nativo apenas preserva os pixels de legenda já existentes na imagem do vídeo, sem refazer OCR, traduzir ou reescrever; o modo script desenha falas com marcações de tempo e já revisadas em quadros reais do vídeo, indicando claramente que se trata de legenda de pós-produção. Se o vídeo tiver apenas uma faixa de legendas independente e desativável, o Skill deve primeiro explicar a limitação e, somente após consentimento, pode mudar para o modo script, evitando misturar os dois modos. O fluxo completo inclui obtenção da fonte, verificação de quadros reais, identificação de legendas gravadas ou de faixas independentes, localização por transcrição, seleção de tópicos e frases, retorno aos quadros reais para calibrar os pontos de tempo, geração de manifest ou lines JSON, renderização compacta em 3:4 e inspeção visual quadro a quadro. O repositório oferece três formas de trabalho: finalização local, processamento completo por URL e produção de conteúdo em conjunto com o Skill de seleção e redação. Os scripts podem gerar uma visão geral de quadros candidatos com amostragem uniforme ou quadros iniciais, intermediários e finais em torno de pontos de tempo especificados; em seguida, é possível pré-visualizar a área de corte da legenda e exportar JPGs de legenda nativa ou de legenda script. Tarefas com várias imagens geram uma visão geral em formato contact sheet e mantêm uma lista de pontos de tempo. O layout segue a norma de imagem principal ocupando a maior parte da altura, faixas de legenda compactas e contínuas, sem espaços extras entre elas, ajustando automaticamente a proporção da imagem principal conforme o número de faixas. As dependências principais incluem Python 3.10+, Pillow, imageio-ffmpeg ou FFmpeg de sistema; o modo URL requer adicionalmente yt-dlp e Deno ou Node.js; o modo script precisa de fontes CJK ao desenhar textos em chinês, japonês ou coreano. O projeto fornece diagnóstico de ambiente em modo somente leitura, verificação de versão não bloqueadora e testes em GitHub Actions. No modo URL, ao encontrar login ou verificação de idade do YouTube, e com autorização explícita do usuário, o yt-dlp pode ler temporariamente os cookies do Chrome. A documentação informa que os cookies não são exportados, salvos, enviados nem gravados no repositório. O código e as instruções do Skill usam a MIT License; os vídeos de entrada, as imagens geradas e o conteúdo de terceiros nelas contido não recebem autorização adicional por essa licença.