vtmateは、超低遅延と41言語対応を特徴とするターミナルベースの音声AIツールキットです。統合TTS/STTエンジンを備え、ライブ会話、ディベート、ボイスクローニング、セッション書き出し、グローバルショートカットを用いたバックグラウンドデーモンモードなどを実現し、シームレスなAIインタラクションを提供します。
オープンソース。新しい可能性。
優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。
好奇心とともに、オープンソースの世界へ。
THE FIRST COLLECTIONOpenCreatorはマルチモーダルコンテンツ作成とエージェントワークスペースを統合したオープンソースAIツール。Codex CLIをエンジンとし、動画翻訳・ダウンロード・サムネイル生成・画像生成・吹き替え・動画生成などのクリエイターツールを提供する。
Unslothは、Windows、macOS、Linuxで大規模言語モデル(LLM)や拡散モデルをローカルに実行およびトレーニングするためのデスクトップアプリケーションおよびフレームワークです。
Verbaは、AIコーチとの会話で言語を学ぶオフライン優先のデスクトップアプリです。Ollamaや自分のプロバイダーキーでローカル動作し、インライン添削、レベル別リーディング、語彙の間隔反復、同梱の音声とディクテーションを提供します。
YouTubeビデオにリアルタイムで二言語の字幕翻訳を提供する、Google ChromeおよびMozilla Firefox向けのブラウザ拡張機能です。
LocalAIは、CPU専用を含むあらゆるハードウェアでLLM、ビジョン、音声、画像、ビデオモデルを実行するオープンソースのセルフホスト型AIエンジンです。OpenAI、Anthropic、ElevenLabs互換のAPI、オンデマンドのモジュラーバックエンド、マルチユーザー認証、RAGとMCPを備えた組み込みエージェントを提供します。
VoxCPM2は、トークナイザー不要のテキスト読み上げシステムで、2Bパラメータの拡散自己回帰モデルを持ち、30言語をサポートし、テキスト説明からの音声デザイン、制御可能な音声クローン、48kHz音声出力を提供します。
Pixelle-VideoはAIによる自動ショート動画生成エンジン。テーマを入力するだけで脚本作成、AI画像・動画生成、音声合成、BGM追加、動画合成を自動で行い、複数のAIモデルやワークフローを柔軟に組み合わせ可能。
ターミナルベースのPython実践コース。Neovimスタイルのモーダルエディタでコードを書き、ローカルTTS音声のコーチングを受けながらオフラインで学習します。ドリルや、git、Docker、AWS、Terraform、Ansible、CI/CDを含むシミュレートされたクラウド/DevOpsトラックを搭載しています。
ChatTTSは会話シナリオ向けのオープンソーステキストtoスピーチモデルで、英語・中国語をサポートし、笑い、ポーズ、プロソディの細かい制御が可能。
GPT-SoVITSは、中国語・日本語・韓国語・広東語・英語に対応したオープンの few-shot 音声変換・TTSシステム。5秒のサンプルでゼロショット、約1分でフューショット学習が可能。WebUIツール付き。
オープンソースの動画翻訳ツールで、音声文字起こし・AI吹き替え・字幕翻訳機能を備え、ローカルオフライン展開と各種オンラインAPIに対応しています。
NVIDIA NeMo Speechは、Apache-2.0のPyTorchフレームワークで、ASR、TTS、音声LLMを対象とし、事前学習済みチェックポイントとDocker/uvインストールを提供する音声AIモデル構築・カスタマイズ・デプロイ用です。
FunTTSは、統一インターフェースを備えたテキスト読み上げ(TTS)ライブラリであり、多様なオープンソースTTSエンジンのシームレスな切り替え、字幕生成、複数キャラクターの対話、非同期処理などの機能を提供します。