このプロジェクトについて
VideoCaptionerは大規模言語モデル(LLM)を活用した動画字幕処理ツールであり、音声認識から字幕最適化、翻訳、動画合成までの一連のワークフローをカバーする。インストールは`pip install videocaptioner`で、CLIコマンドライン版とGUIデスクトップ版の2つの利用方法を提供する。
主要機能:
- 音声文字起こし: faster-whisper、whisper-api、bijian(無料)、jianying(無料)、whisper-cppなど複数のエンジンに対応し、単語レベルの時系列タイムスタンプとVAD音声活動検出により識別精度を向上させる。
- 字幕最適化・翻訳: LLMによる意味理解で文節分けを行い、自然な視聴体験を実現する。翻訳はLLM、bing(無料)、google(無料)に対応し、コンテキスト認識翻訳とリフレクション最適化機能を備える。
- 動画合成: サブタイトルをソフトサブやハードサブとして動画に埋め込める。
- 吹き替え生成: 字幕に基づいて吹き替え音声トラックや吹き替え動画を生成可能。
- オンライン動画ダウンロード: YouTube、Bilibiliなどのプラットフォームに対応。
- フルプロセス処理: 1コマンドで文字起こし→最適化→翻訳→合成を完了する。
無料機能(必剪音声認識、Bing/Google翻訳)は設定なしですぐに利用可能。LLM機能(字幕最適化、大規模モデル翻訳)にはAPI Keyの設定が必要で、OpenAI互換インターフェース全般をサポートし、VideoCaptioner中継站、SiliconCloud、DeepSeekなどに対応する。設定の優先順位はCLI引数>環境変数>設定ファイル>既定値となる。
また本プロジェクトはClaude Code Skillを提供し、AIプログラミングアシスタントがVideoCaptionerを直接呼び出して動画処理できるようにしている。開発面ではuvによる依存関係管理、pyright型チェック、pytestテストに対応し、GPL-3.0ライセンスで公開されている。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.