このプロジェクトについて
このプロジェクトは、動画コンテンツをソーシャル共有用の画像に整理する必要がある利用者向けに、Agent Skill の形でフレーム選択、字幕処理、コラージュ作成、品質確認の機能を提供します。ローカル動画をサポートするほか、yt-dlp を通じて利用者が使用権を持つオンライン動画を処理できます。URL モードではメタデータと字幕トラックを取得することもでき、Whisper などの音声認識機能を任意で使用して時間インデックスを構築できます。
プロジェクトは字幕の来源を2種類に区別します。ネイティブモードは、動画画面にすでに存在する字幕のピクセルを保持するだけで、OCR による再描画、翻訳、書き換えは行いません。スクリプトモードは、タイムポイント付きで審査済みの台詞を実際の動画フレームに描画し、それがポストプロダクション字幕であることを明確にします。動画がオフにできる独立した字幕トラックしか持たない場合、Skill はまず制限事項を説明し、同意を得た後でなければスクリプトモードへ移行できないようにして、2つのモードの混同を避けます。
完全なフローには、来源の取得、実フレームの確認、焼き込み字幕か独立字幕トラックかの判定、文字稿を使った位置特定、テーマと文の選択、実フレームに戻ってタイムポイントを調整する作業、manifest または lines JSON の生成、3:4 のコンパクトなレンダリング、1枚ずつの目視による品質確認が含まれます。リポジトリには、ローカルの完成動画を扱う方法、URL を完全処理する方法、テーマ執筆 Skill と連携してコンテンツを制作する方法という3つのワークフローが用意されています。
スクリプトは、均一にサンプリングした候補フレーム一覧を生成できるほか、指定したタイムポイントの前・中・後のフレームを生成できます。その後、字幕の切り抜き領域をプレビューし、ネイティブ字幕またはスクリプト字幕の JPG を出力できます。複数画像タスクでは、コンタクトシート式の全体像を生成すると同時に、タイムポイント一覧も保持します。レイアウトは、メイン画像が主要な高さを占め、字幕バーがコンパクトに連続し、バー間に余分な隙間を入れない規則を採用し、字幕バーの数に応じてメイン画像の比率を自動調整します。
主要な依存関係は Python 3.10+、Pillow、imageio-ffmpeg またはシステム FFmpeg です。URL モードではさらに yt-dlp と Deno または Node.js が必要で、スクリプトモードで中日韓文字を描画するには CJK フォントが必要です。プロジェクトは、読み取り専用の環境診断、非ブロッキングなバージョン確認、GitHub Actions テストを提供します。
URL モードで YouTube のログインや年齢確認が必要になった場合、利用者の明確な許可を得た後に、yt-dlp に一時的に Chrome Cookie を読み取らせることができます。ドキュメントでは、Cookie はエクスポート、保存、アップロードされず、リポジトリにも書き込まれないと説明されています。コードと Skill 命令は MIT License で提供されますが、入力動画、生成画像、およびそれらに含まれる第三者コンテンツについては、このライセンスによって追加の許諾が得られるものではありません。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.