ESPnetはPyTorchベースのエンドツーエンド音声処理ツールキットで、ASR、TTS、音声翻訳、強調、話者分離など幅広いタスクをカバーし、再現可能なレシピと事前学習モデルを提供します。
オープンソース。新しい可能性。
優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。
好奇心とともに、オープンソースの世界へ。
THE FIRST COLLECTIONWhisperLiveKitは、自己ホスト型で超ローレイテンシーな音声認識パイプラインです。WebSocketおよびOpenAI/Deepgram互換APIを介し、リアルタイム文字起こし、話者分離、翻訳を提供します。
Batchalign3は、CHATトランスクリプトの作成と拡充のためのTalkBankオーディオおよびMLパイプラインであり、ASR、強制アライメント、ニューラル形態論タグ付け、翻訳、発話セグメンテーションをカバーしています。CLI、Pythonパッケージ、PyO3ブリッジ、Reactダッシュボード、実験的なTauriデスクトップシェルを提供します。
SpeechRecognitionは、オンライン/オフラインの多様なエンジンやAPIをサポートするPython音声認識ライブラリ。CMU Sphinx、Google、Azure、IBM、Vosk、Whisper、OpenAIなどに対応。
Mimoraは、英語とスペイン語の完全ローカルな発音トレーナーで、クラウドやAPIキーを必要としない。オンデバイスのTTS、音声認識、ローカルLLMを使用してフレーズを生成し、単語レベルのフィードバックでユーザーの試行をスコアリングする。
OpenAIのWhisper自動音声認識(ASR)モデルを軽量かつクロスプラットフォームで展開するために設計された、高性能なC/C++実装です。
Premove ITNは、英語の音声エージェント文字起こし向けのオープンソースの文脈対応逆テキスト正規化ツールです。DeBERTaによる文脈スコアリングを用いた生成・スコア・デコードのパイプラインで、ASR出力を正規な表記に変換します。
CTranslate2を使用したOpenAIのWhisperモデルの高速な再実装であり、文字起こし速度の向上とメモリ使用量の削減を実現します。
Hugging Face Transformersは、テキスト、ビジョン、オーディオ、マルチモーダルタスクに対応した機械学習用モデル定義フレームワークです。100万以上の学習済みチェックポイントを備え、推論と学習のための統一APIを提供します。
SenseVoiceSmallは、ASR、言語識別、感情認識、音声イベント検出を備えたオープンソースの音声基盤モデルで、中国語、広東語、英語、日本語、韓国語に対応し、高速な非自己回帰推論を実現します。