espnetespnet
新着ESPnetはPyTorchベースのエンドツーエンド音声処理ツールキットで、ASR、TTS、音声翻訳、強調、話者分離など幅広いタスクをカバーし、再現可能なレシピと事前学習モデルを提供します。
優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。
好奇心とともに、オープンソースの世界へ。
THE FIRST COLLECTIONESPnetはPyTorchベースのエンドツーエンド音声処理ツールキットで、ASR、TTS、音声翻訳、強調、話者分離など幅広いタスクをカバーし、再現可能なレシピと事前学習モデルを提供します。
FunTTSは、統一インターフェースを備えたテキスト読み上げ(TTS)ライブラリであり、多様なオープンソースTTSエンジンのシームレスな切り替え、字幕生成、複数キャラクターの対話、非同期処理などの機能を提供します。
Speech To Speechは、VAD→STT→LLM→TTSのモジュラー音声エージェントパイプラインで、WebSocketおよびWebRTC上でOpenAI Realtimeイベントセットを実装する低レイテンシフレームワークです。