ChatMonteurは、トーキングヘッド形式の映像向けにエージェントがオーケストレーションを行うAIビデオエディターです。Claude CodeやCodexによって駆動し、文字起こし、意味ベースのカット、キャプション、モーショングラフィックス、音響、カラーグレーディングを自動化します。2つの品質ゲートで不備を排除し、基本は無料でローカル動作します。
オープンソース。新しい可能性。
優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。
好奇心とともに、オープンソースの世界へ。
THE FIRST COLLECTION許可された YouTube 動画を中文字幕付きにローカライズし、B 站への投稿をサポートする Python ツール。音声文字起こし、OCR 認識、LLM 翻訳、ハードサブタイトルレンダリングに対応。
Voiceboxは、ローカル環境で動作するオープンソースのAI音声スタジオです。音声クローンやテキスト読み上げ、Whisperによる音声入力を備え、MCP経由でAIエージェントに音声出力機能を提供します。
Magneticは、マグネットタイムラインとAI支援編集ツールを備えたWindows向けのフリーでオープンソースの非線形ビデオエディターです。
Verbaは、AIコーチとの会話で言語を学ぶオフライン優先のデスクトップアプリです。Ollamaや自分のプロバイダーキーでローカル動作し、インライン添削、レベル別リーディング、語彙の間隔反復、同梱の音声とディクテーションを提供します。
Soenneker.Libraries.Whisper.CTranslateによって公開されるWindows実行ファイルを最新の状態に保つための自動化ランナーであり、スケジュール設定およびオンデマンドのGitHub Actionsワークフローによって駆動されます。
LearnNoteは、BilibiliやYouTubeなどのブラウザ動画、およびローカル動画やPDFなどの資料から、字幕や文字起こしに基づいた構造化ノートを生成するローカル優先のAI学習アシスタントです。ウェブワークベンチでの閲覧、編集、追問、エクスポートをサポートしています。
OpenAIのWhisper自動音声認識(ASR)モデルを軽量かつクロスプラットフォームで展開するために設計された、高性能なC/C++実装です。
SkyClass Distillは、教育ビデオを構造化されたティーチングスキル(Teaching Skills)に変換するパイプラインツールであり、ビデオ収集、文字起こし、エビデンス抽出、およびLLMによる蒸留をサポートします。
Xinferenceは、言語・音声・マルチモーダルモデルの提供に対応した統合推論ライブラリです。OpenAI互換RESTful API、異種GPU/CPU活用、分散配置を提供し、LangChain、LlamaIndex、Dify、Chatboxと連携します。
話者別のレーンを備えたブラウザベースの字幕エディタ。文字起こしから修正、書き出しまでを効率化します。
by2kbは、BilibiliやYouTubeなどの動画URLを、文字起こし、要約、学習ノートを含む永続的なMarkdownナレッジベース成果物に変換します。エージェントファーストのワークフローとローカル/クラウドASRをサポートします。
WhisperとGeminiを活用し、タイ語と英語に対応したAI搭載の自動動画編集ツール。GPUとDockerの利用により、重要セグメントのカットや字幕生成などの処理速度を3〜4倍に向上させています。
CTranslate2を使用したOpenAIのWhisperモデルの高速な再実装であり、文字起こし速度の向上とメモリ使用量の削減を実現します。
Tandemは、電子書籍とオーディオブックの間で読書位置を同期させるセルフホスト型サーバーおよびWeb/Androidクライアントです。Whisperで音声を文字起こしし、EPUBテキストと文単位で整合させることで、フォーマットを跨いだシームレスな同期を実現します。
LazyEditは、コンテンツの作成、処理、およびオプションの公開までをエンドツーエンドで完結させる、ローカルファーストでAI支援型のビデオワークフローです。
WhisperLiveKitは、自己ホスト型で超ローレイテンシーな音声認識パイプラインです。WebSocketおよびOpenAI/Deepgram互換APIを介し、リアルタイム文字起こし、話者分離、翻訳を提供します。