Об этом проекте
Этот проект предназначен для пользователей, которым нужно превращать видеоконтент в изображения для соцсетей, и предоставляется как навык агента, охватывающий выбор кадров, обработку субтитров, создание коллажей и контроль качества. Он поддерживает локальные видео, а также онлайн-видео через yt-dlp, если у пользователя есть права на их использование; в режиме URL можно получать метаданные и дорожки субтитров, а также использовать Whisper или другие системы распознавания речи для создания временных индексов. Проект различает два источника субтитров: нативный режим сохраняет только пиксели субтитров, уже присутствующие в кадре, без OCR-перерисовки, перевода или переписывания; скриптовый режим наносит проверенные диалоги с таймкодами на реальные кадры видео и явно относится к пост-обработке. Если видео имеет только отдельную дорожку субтитров, которую можно отключить, навык требует сначала объяснить ограничения и получить согласие перед переходом в скриптовый режим, чтобы избежать смешивания режимов. Полный процесс включает получение источника, проверку реальных кадров, определение встроенных или отдельных дорожек субтитров, локализацию транскрипта, выбор фраз, калибровку таймкодов по реальным кадрам, создание манифеста или JSON со строками, компактный рендеринг 3:4 и визуальную проверку каждого изображения. Репозиторий предлагает три рабочих процесса: локальное готовое видео, полная обработка по URL и создание контента в сочетании с навыком написания сюжетов. Скрипт может генерировать равномерно выбранные обзоры кадров-кандидатов или кадры до/после указанного таймкода; затем можно предпросматривать область обрезки субтитров и выводить JPG с нативными или скриптовыми субтитрами. Для задач с несколькими изображениями создаётся контактный лист-обзор, сохраняя список таймкодов. Макет следует правилам: основное изображение занимает основную высоту, полосы субтитров компактны и непрерывны, без лишних промежутков, а пропорции основного изображения автоматически подстраиваются под количество полос. Основные зависимости включают Python 3.10+, Pillow, imageio-ffmpeg или системный FFmpeg; режим URL дополнительно требует yt-dlp и Deno или Node.js; для отрисовки CJK-текста в скриптовом режиме нужен шрифт CJK. Проект предоставляет диагностику среды только для чтения, неблокирующую проверку версий и тесты GitHub Actions. В режиме URL при входе в YouTube или возрастных ограничениях yt-dlp может временно читать Cookie Chrome после явного разрешения пользователя; документация указывает, что Cookie не экспортируются, не сохраняются, не загружаются и не записываются в репозиторий. Код и инструкции навыка распространяются под лицензией MIT, но входные видео, сгенерированные изображения и сторонний контент в них не получают дополнительных прав по этой лицензии.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.