প্রকল্প সম্পর্কে

该项目面向需要将视频内容整理为社交分享图的用户,以 Agent Skill 形式提供选帧、字幕处理、拼图和质检能力。它支持本地视频,也可通过 yt-dlp 处理用户有权使用的在线视频;URL 模式还可获取元数据与字幕轨,并可选用 Whisper 或其他语音识别能力建立时间索引。项目区分两种字幕来源:原生模式只保留视频画面中已有的字幕像素,不做 OCR 重绘、翻译或改写;脚本模式将带时间点且已审核的台词绘制到真实视频帧上,并明确属于后期字幕。若视频只有可关闭的独立字幕轨,Skill 要求先说明限制,取得同意后才能转入脚本模式,避免两种模式混用。完整流程包括来源获取、检查真实帧、判断烧录字幕或独立字幕轨、文字稿定位、选题选句、回到真实帧校准时间点、生成 manifest 或 lines JSON、紧凑 3:4 渲染以及逐张视觉质检。仓库提供本地成片、URL 完整处理和与选题写作 Skill 配合的内容生产三种工作方式。脚本可生成均匀抽样的候选帧总览,也可围绕指定时间点生成前中后帧;随后可预览字幕裁切区域,并输出原生字幕或脚本字幕 JPG。多图任务会生成联系表式总览图,同时保留时间点清单。版式上采用主图占主要高度、字幕条紧凑连续、条间无多余空隙的规范,并根据字幕条数量自动调整主图比例。核心依赖包括 Python 3.10+、Pillow、imageio-ffmpeg 或系统 FFmpeg;URL 模式额外需要 yt-dlp 与 Deno 或 Node.js;脚本模式绘制中日韩文字时需要 CJK 字体。项目提供只读环境诊断、非阻塞版本检查和 GitHub Actions 测试。URL 模式遇到 YouTube 登录或年龄验证时,可在用户明确授权后让 yt-dlp 临时读取 Chrome Cookie;文档说明 Cookie 不导出、不保存、不上传,也不写入仓库。代码与 Skill 指令采用 MIT License,输入视频、生成图片及其中第三方内容不随该许可证获得额外授权。