このプロジェクトについて
OpenCreator(旧KrillinAI)は、マルチモーダルコンテンツ作成と一般的なAgentワークスペースを組み合わせたオープンソースのAIワークスペースです。Codex CLIを実行エンジンとして採用し、その周りにローカルランタイム、ビジュアルワークスペース、デスクトップホストを追加しています。
この製品は2つの連携したワークフローを集約しています:
1. AIコンテンツ作成:動画翻訳、動画ダウンロード、サムネイル生成、画像生成、スマート吹き替え、動画生成のための専用クリエイターツール。
2. 汎用Agentワークスペース:プロジェクトごとの会話整理、バックグラウンドでのRun実行、承認・添付ファイル・ファイル・Skills・MCP・スケジュール・通知・メモリ・診断の管理。
現在利用可能なクリエイターツールは以下の通りです:
- 動画翻訳:ローカルまたは公開動画を取り込み、クラウドまたはローカルのWhisperで文字起こしし、LLMによる字幕分割・整列・用語管理・翻訳を実行。二重字幕、吹き替え、字幕スタイルを設定し、SRT/オーディオ/ビデオとしてエクスポート。
- 動画ダウンロード:YouTube、Bilibiliなどの公開リンクから解析し、画質・フォーマットオプションを確認して動画またはオーディオをダウンロード。
- サムネイル生成:トピック、動画リンク、任意のリファレンス画像を組み合わせて複数のサムネイルバリエーションを生成。
- 画像生成:プロンプトと任意のリファレンス画像からGPT Imageで生成。アスペクト比と出力件数を設定可能。
- スマート吹き替え:スクリプトを選択可能な音声、ペース、感情コントロールで音声に変換。
- 動画生成:プロンプトとリファレンス画像からSeedanceで動画を生成。
開発中のツールには、スタックファイアーアニメーション、Auto Clips、デジタルアバターが含まれます。
ワークスペースとAgent会話は単一のステートマシンを共有し、ステップ・進捗・結果を同期させます。各リビジョンは既存結果を上書きせずに新しいバージョンを作成します。システムはグローバル・プロジェクト・スレッドのメモリをサポートし、再現可能なRun入力スナップショットを提供します。
対応モデルは言語モデル(GPT、DeepSeek、Qwen、Kimi、GLM、Grok、Doubao、ERNIE、Hunyuan)、画像(GPT Image)、動画(Seedance)、音声/文字起こし(Whisper、OpenAI TTS、MiniMax、Edge TTS、Aliyun Speech)を幅広くカバーします。
アーキテクチャは、React 18/Vite/TypeScriptフロントエンド、Fastifyベースのローカルデamon Runtime、Electronデスクトップホスト、yt-dlp・FFmpeg・Whisperを用いたメディアツールチェーンで構成されます。データはSQLiteとファイルシステムでローカル保存され、資格情報はシステム資格記憶装置に格納されます。本プロジェクトはApache 2.0ライセンスで提供されます。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.