OPEN SOURCE, OPEN TO EVERYONE

オープンソース。新しい可能性。

優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。

編集部選定 · 良いオープンソースを発見4109発見済み

好奇心とともに、オープンソースの世界へ。

THE FIRST COLLECTION
Topic: speech-to-text清除
LLM_Pluginisundahl
新着

Unreal Engine 5向けのローカルマルチモーダルLLMプラグイン。テキスト、音声認識(STT)、音声合成(TTS)のオフライン推論を提供します。

ゲーム人工知能Game development tools
speech-to-speechhuggingface
新着

Speech To Speechは、VAD→STT→LLM→TTSのモジュラー音声エージェントパイプラインで、WebSocketおよびWebRTC上でOpenAI Realtimeイベントセットを実装する低レイテンシフレームワークです。

人工知能開発ツールAI assistants
douvorhinoc
新着

Douvoは、Apple Silicon搭載Mac向けの軽量macOS音声入力アプリで、Doubao ASRを利用し、オプションでローカルまたはリモートのAI後処理によるテキスト整形、翻訳、選択テキスト編集を提供します。

生産性人工知能Utilities
lexoscauafsantosdev
新着

Lexosは、Goゲートウェイ、Pythonワーカー、Redisキュー、セルフホストモデルを組み合わせたイベント駆動型AI文書処理エンジンで、オフラインRAG、要約、音声文字起こしを実現します。

人工知能セルフホストRAG & knowledge
新着

SpeechRecognitionは、オンライン/オフラインの多様なエンジンやAPIをサポートするPython音声認識ライブラリ。CMU Sphinx、Google、Azure、IBM、Vosk、Whisper、OpenAIなどに対応。

人工知能開発ツールMultimodal AI
whisper.cppggml-org
新着

OpenAIのWhisper自動音声認識(ASR)モデルを軽量かつクロスプラットフォームで展開するために設計された、高性能なC/C++実装です。

人工知能Model runtime
boloa692570
新着

Boloは、Rustで書かれた無料のセルフホスト型macOSプッシュ・トゥ・トーク辞書アプリです。ホットキーを押しながら話すと、Telnyx AIの音声認識で文字起こしされ、カーソル位置に貼り付けられます。オプションでLLMによるクリーンアップや、ローカルでの文字起こし履歴保存も可能です。

生産性人工知能Utilities
skyclass-distillRicardo-Ssy
新着

SkyClass Distillは、教育ビデオを構造化されたティーチングスキル(Teaching Skills)に変換するパイプラインツールであり、ビデオ収集、文字起こし、エビデンス抽出、およびLLMによる蒸留をサポートします。

人工知能生産性AI agents
typenomarswaveai
新着

TypeNoはmacOS向けのプライバシー重視の音声入力ツール。Controlキーで録音し、coliエンジンでローカル转写して即座に入力に貼り付け。設定不要、クラウド処理なし。

音楽Audio editing
新着

Velo AI Studioは、スクリプト、音声、AI生成ビジュアルアセットからナレーション付きビデオを組み立てるために設計されたオープンソースのブラウザベースのビデオ作成ツールです。

音楽DAW & production
新着

CTranslate2を使用したOpenAIのWhisperモデルの高速な再実装であり、文字起こし速度の向上とメモリ使用量の削減を実現します。

人工知能Model runtime
sensevoiceQwenAudio
新着

SenseVoiceSmallは、ASR、言語識別、感情認識、音声イベント検出を備えたオープンソースの音声基盤モデルで、中国語、広東語、英語、日本語、韓国語に対応し、高速な非自己回帰推論を実現します。

人工知能開発ツールModel runtime
LazyEditlachlanchen
編集部おすすめ

LazyEditは、コンテンツの作成、処理、およびオプションの公開までをエンドツーエンドで完結させる、ローカルファーストでAI支援型のビデオワークフローです。

動画・映像メディア人工知能Video editing
pyvideotransjianchang512
新着

オープンソースの動画翻訳ツールで、音声文字起こし・AI吹き替え・字幕翻訳機能を備え、ローカルオフライン展開と各種オンラインAPIに対応しています。

人工知能動画・映像メディアMultimodal AI
handycjpais
新着

Handyは、完全オフラインで動作する無料・オープンソースのクロスプラットフォーム音声文字起こしデスクトップアプリです。ショートカットを押して話すと、WhisperまたはParakeetモデルで文字起こしされたテキストが任意の入力欄に貼り付けられます。

人工知能生産性Multimodal AI
whisperlivekitQuentinFuxa
新着

WhisperLiveKitは、自己ホスト型で超ローレイテンシーな音声認識パイプラインです。WebSocketおよびOpenAI/Deepgram互換APIを介し、リアルタイム文字起こし、話者分離、翻訳を提供します。

人工知能開発ツールModel runtime
lamitypefelixfu824
新着

Lamitypeは、無料・オープンソース・プライバシー重視のmacOS向け音声文字起こしアプリです。Apple Silicon上でデフォルトでQwen3-ASRモデルをローカル実行し、繁体中国語優先の出力、リアルタイム字幕、テキスト翻訳・校正をサポートし、オプションのクラウドディクテーション機能も提供します。

生産性人工知能Utilities