voxcpmOpenBMB
新着VoxCPM2は、トークナイザー不要のテキスト読み上げシステムで、2Bパラメータの拡散自己回帰モデルを持ち、30言語をサポートし、テキスト説明からの音声デザイン、制御可能な音声クローン、48kHz音声出力を提供します。
優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。
好奇心とともに、オープンソースの世界へ。
THE FIRST COLLECTIONVoxCPM2は、トークナイザー不要のテキスト読み上げシステムで、2Bパラメータの拡散自己回帰モデルを持ち、30言語をサポートし、テキスト説明からの音声デザイン、制御可能な音声クローン、48kHz音声出力を提供します。
NVIDIA NeMo Speechは、Apache-2.0のPyTorchフレームワークで、ASR、TTS、音声LLMを対象とし、事前学習済みチェックポイントとDocker/uvインストールを提供する音声AIモデル構築・カスタマイズ・デプロイ用です。
ESPnetはPyTorchベースのエンドツーエンド音声処理ツールキットで、ASR、TTS、音声翻訳、強調、話者分離など幅広いタスクをカバーし、再現可能なレシピと事前学習モデルを提供します。
FunTTSは、統一インターフェースを備えたテキスト読み上げ(TTS)ライブラリであり、多様なオープンソースTTSエンジンのシームレスな切り替え、字幕生成、複数キャラクターの対話、非同期処理などの機能を提供します。
Speech To Speechは、VAD→STT→LLM→TTSのモジュラー音声エージェントパイプラインで、WebSocketおよびWebRTC上でOpenAI Realtimeイベントセットを実装する低レイテンシフレームワークです。