NVIDIA NeMo Speechは、Apache-2.0のPyTorchフレームワークで、ASR、TTS、音声LLMを対象とし、事前学習済みチェックポイントとDocker/uvインストールを提供する音声AIモデル構築・カスタマイズ・デプロイ用です。
オープンソース。新しい可能性。
優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。
好奇心とともに、オープンソースの世界へ。
THE FIRST COLLECTIONDouvoは、Apple Silicon搭載Mac向けの軽量macOS音声入力アプリで、Doubao ASRを利用し、オプションでローカルまたはリモートのAI後処理によるテキスト整形、翻訳、選択テキスト編集を提供します。
Batchalign3は、CHATトランスクリプトの作成と拡充のためのTalkBankオーディオおよびMLパイプラインであり、ASR、強制アライメント、ニューラル形態論タグ付け、翻訳、発話セグメンテーションをカバーしています。CLI、Pythonパッケージ、PyO3ブリッジ、Reactダッシュボード、実験的なTauriデスクトップシェルを提供します。
YouTubeの字幕・文字起こしを取得するPythonライブラリ。APIキーやヘッドレスブラウザを必要とせず、多言語対応・翻訳・出力フォーマットをサポート。
Mimoraは、英語とスペイン語の完全ローカルな発音トレーナーで、クラウドやAPIキーを必要としない。オンデバイスのTTS、音声認識、ローカルLLMを使用してフレーズを生成し、単語レベルのフィードバックでユーザーの試行をスコアリングする。
Premove ITNは、英語の音声エージェント文字起こし向けのオープンソースの文脈対応逆テキスト正規化ツールです。DeBERTaによる文脈スコアリングを用いた生成・スコア・デコードのパイプラインで、ASR出力を正規な表記に変換します。
SenseVoiceSmallは、ASR、言語識別、感情認識、音声イベント検出を備えたオープンソースの音声基盤モデルで、中国語、広東語、英語、日本語、韓国語に対応し、高速な非自己回帰推論を実現します。