voxcpmOpenBMB
新着VoxCPM2は、トークナイザー不要のテキスト読み上げシステムで、2Bパラメータの拡散自己回帰モデルを持ち、30言語をサポートし、テキスト説明からの音声デザイン、制御可能な音声クローン、48kHz音声出力を提供します。
優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。
好奇心とともに、オープンソースの世界へ。
THE FIRST COLLECTIONVoxCPM2は、トークナイザー不要のテキスト読み上げシステムで、2Bパラメータの拡散自己回帰モデルを持ち、30言語をサポートし、テキスト説明からの音声デザイン、制御可能な音声クローン、48kHz音声出力を提供します。
ModelScopeはModel-as-a-Serviceを実装するオープンソースPythonライブラリで、CV、NLP、音声、マルチモーダル、科学モデルの推論・ファインチューニング・評価のための統一pipeline、Trainer、MsDatasetインターフェースとモデル/データセットハブ連携を提供します。
Speech To Speechは、VAD→STT→LLM→TTSのモジュラー音声エージェントパイプラインで、WebSocketおよびWebRTC上でOpenAI Realtimeイベントセットを実装する低レイテンシフレームワークです。