このプロジェクトについて

Video Analyzerは、映像と音声の両方の情報から動画コンテンツの説明を生成するコマンドラインツールです。そのパイプラインは、キーフレーム抽出と音声処理、フレームごとの視覚分析、最終的な動画再構成の3つの主要段階で構成されています。 このアナライザーは、OpenCVを使用してキーフレームを選択し、OpenAI Whisperを使用して利用可能な音声を文字起こしします。これには、低品質な音声のチェックも含まれます。抽出された各フレームは、視覚認識可能な言語モデルに送信され、以前のフレームからのコンテキストを使用して時系列の進行を保持します。フレーム分析と文字起こしは、包括的な説明に統合されます。デフォルトでは、ローカル推論にOllamaとLlama 3.2 Visionモデルを使用します。ユーザーは、CLIオプションまたはJSON設定ファイルを通じて、OpenAIやOpenRouterなどの任意のOpenAI互換エンドポイントを設定することもできます。 報告されている機能には、クラウドサービスやAPIキーを必要としない完全ローカル動作、オプションのクラウドAPI、設定可能なWhisperおよびビジョンモデル、カスタムプロンプト、メタデータ、文字起こし、フレーム分析、最終説明を含む詳細なJSON出力、およびコマンドライン引数がユーザー設定とデフォルトを上書きするカスケード設定システムが含まれます。 必要条件には、Python 3.11以降とFFmpegが含まれます。READMEでは、ローカルLLM実行には十分なRAMとGPU/Apple Siliconハードウェアを推奨していますが、APIベースの使用ではこれらのローカルモデル要件は不要です。インストールは、リポジトリをクローンし、pipでインストールすることで行われます。オプションのvideo-analyzer-tuneパッケージは、DSPy MIPROv2を使用して代表的な編集済み出力からプロンプトテンプレートを最適化し、調整されたプロンプトを別のファイルに書き込みます。このプロジェクトはApacheライセンスの下でリリースされており、使用法、設計、貢献に関するドキュメントが含まれています。