GPT-SoVITSは、中国語・日本語・韓国語・広東語・英語に対応したオープンの few-shot 音声変換・TTSシステム。5秒のサンプルでゼロショット、約1分でフューショット学習が可能。WebUIツール付き。
オープンソース。新しい可能性。
優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。
好奇心とともに、オープンソースの世界へ。
THE FIRST COLLECTIONオープンソースの動画翻訳ツールで、音声文字起こし・AI吹き替え・字幕翻訳機能を備え、ローカルオフライン展開と各種オンラインAPIに対応しています。
ESPnetはPyTorchベースのエンドツーエンド音声処理ツールキットで、ASR、TTS、音声翻訳、強調、話者分離など幅広いタスクをカバーし、再現可能なレシピと事前学習モデルを提供します。
Unreal Engine 5向けのローカルマルチモーダルLLMプラグイン。テキスト、音声認識(STT)、音声合成(TTS)のオフライン推論を提供します。
FunTTSは、統一インターフェースを備えたテキスト読み上げ(TTS)ライブラリであり、多様なオープンソースTTSエンジンのシームレスな切り替え、字幕生成、複数キャラクターの対話、非同期処理などの機能を提供します。
MoneyPrinterTurbo は、テーマやキーワードを入力するだけで脚本、音声、素材、字幕、BGM、編集を自動で行い、9:16、16:9、1:1 の高画質動画を出力するオールインワン AI ショート動画生成ツールです。WebUI、API、CLI、AI Agent の 4 つの利用方法に対応しています。
Mimoraは、英語とスペイン語の完全ローカルな発音トレーナーで、クラウドやAPIキーを必要としない。オンデバイスのTTS、音声認識、ローカルLLMを使用してフレーズを生成し、単語レベルのフィードバックでユーザーの試行をスコアリングする。
Unslothは、Windows、macOS、Linuxで大規模言語モデル(LLM)や拡散モデルをローカルに実行およびトレーニングするためのデスクトップアプリケーションおよびフレームワークです。
Zaraは、シンボリック論理(Prolog)とLLMを組み合わせた、インテント処理と推論を行う実験的なローカルファーストAIアシスタントおよびLinuxデスクトップコパイロットです。
VoxCPM2は、トークナイザー不要のテキスト読み上げシステムで、2Bパラメータの拡散自己回帰モデルを持ち、30言語をサポートし、テキスト説明からの音声デザイン、制御可能な音声クローン、48kHz音声出力を提供します。
AIをピアノとギターで音楽性を教えるために設計されたMCPサーバー。120曲の注釈付き楽曲、6種類のサウンドエンジン、ブラウザベースの作曲コックピット、ツール使用トレースの公開データセットを特徴とします。
Velo AI Studioは、スクリプト、音声、AI生成ビジュアルアセットからナレーション付きビデオを組み立てるために設計されたオープンソースのブラウザベースのビデオ作成ツールです。
TaleWeaverは、AIゲームマスター、アドベンチャーエディター、RPGメカニクス、音声ナレーション/音声入力を備え、Docker/SQLiteで展開できるセルフホスト型ブラウザベースのAIテキストアドベンチャーエンジンです。
OpenMontageは、AIコーディングアシスタントをフル機能のビデオスタジオに変えるオープンソースのエージェント型ビデオ制作システムであり、リサーチから最終レンダリングまでのエンドツーエンドのパイプラインをサポートします。
ChatTTSは会話シナリオ向けのオープンソーステキストtoスピーチモデルで、英語・中国語をサポートし、笑い、ポーズ、プロソディの細かい制御が可能。