Unreal Engine 5向けのローカルマルチモーダルLLMプラグイン。テキスト、音声認識(STT)、音声合成(TTS)のオフライン推論を提供します。
オープンソース。新しい可能性。
優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。
好奇心とともに、オープンソースの世界へ。
THE FIRST COLLECTIONSpeech To Speechは、VAD→STT→LLM→TTSのモジュラー音声エージェントパイプラインで、WebSocketおよびWebRTC上でOpenAI Realtimeイベントセットを実装する低レイテンシフレームワークです。
Douvoは、Apple Silicon搭載Mac向けの軽量macOS音声入力アプリで、Doubao ASRを利用し、オプションでローカルまたはリモートのAI後処理によるテキスト整形、翻訳、選択テキスト編集を提供します。
Lexosは、Goゲートウェイ、Pythonワーカー、Redisキュー、セルフホストモデルを組み合わせたイベント駆動型AI文書処理エンジンで、オフラインRAG、要約、音声文字起こしを実現します。
SpeechRecognitionは、オンライン/オフラインの多様なエンジンやAPIをサポートするPython音声認識ライブラリ。CMU Sphinx、Google、Azure、IBM、Vosk、Whisper、OpenAIなどに対応。
OpenAIのWhisper自動音声認識(ASR)モデルを軽量かつクロスプラットフォームで展開するために設計された、高性能なC/C++実装です。
Boloは、Rustで書かれた無料のセルフホスト型macOSプッシュ・トゥ・トーク辞書アプリです。ホットキーを押しながら話すと、Telnyx AIの音声認識で文字起こしされ、カーソル位置に貼り付けられます。オプションでLLMによるクリーンアップや、ローカルでの文字起こし履歴保存も可能です。
SkyClass Distillは、教育ビデオを構造化されたティーチングスキル(Teaching Skills)に変換するパイプラインツールであり、ビデオ収集、文字起こし、エビデンス抽出、およびLLMによる蒸留をサポートします。
TypeNoはmacOS向けのプライバシー重視の音声入力ツール。Controlキーで録音し、coliエンジンでローカル转写して即座に入力に貼り付け。設定不要、クラウド処理なし。
Velo AI Studioは、スクリプト、音声、AI生成ビジュアルアセットからナレーション付きビデオを組み立てるために設計されたオープンソースのブラウザベースのビデオ作成ツールです。
CTranslate2を使用したOpenAIのWhisperモデルの高速な再実装であり、文字起こし速度の向上とメモリ使用量の削減を実現します。
SenseVoiceSmallは、ASR、言語識別、感情認識、音声イベント検出を備えたオープンソースの音声基盤モデルで、中国語、広東語、英語、日本語、韓国語に対応し、高速な非自己回帰推論を実現します。
LazyEditは、コンテンツの作成、処理、およびオプションの公開までをエンドツーエンドで完結させる、ローカルファーストでAI支援型のビデオワークフローです。
オープンソースの動画翻訳ツールで、音声文字起こし・AI吹き替え・字幕翻訳機能を備え、ローカルオフライン展開と各種オンラインAPIに対応しています。
Handyは、完全オフラインで動作する無料・オープンソースのクロスプラットフォーム音声文字起こしデスクトップアプリです。ショートカットを押して話すと、WhisperまたはParakeetモデルで文字起こしされたテキストが任意の入力欄に貼り付けられます。
WhisperLiveKitは、自己ホスト型で超ローレイテンシーな音声認識パイプラインです。WebSocketおよびOpenAI/Deepgram互換APIを介し、リアルタイム文字起こし、話者分離、翻訳を提供します。
Lamitypeは、無料・オープンソース・プライバシー重視のmacOS向け音声文字起こしアプリです。Apple Silicon上でデフォルトでQwen3-ASRモデルをローカル実行し、繁体中国語優先の出力、リアルタイム字幕、テキスト翻訳・校正をサポートし、オプションのクラウドディクテーション機能も提供します。