sensevoiceQwenAudio
新着SenseVoiceSmallは、ASR、言語識別、感情認識、音声イベント検出を備えたオープンソースの音声基盤モデルで、中国語、広東語、英語、日本語、韓国語に対応し、高速な非自己回帰推論を実現します。
優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。
好奇心とともに、オープンソースの世界へ。
THE FIRST COLLECTIONSenseVoiceSmallは、ASR、言語識別、感情認識、音声イベント検出を備えたオープンソースの音声基盤モデルで、中国語、広東語、英語、日本語、韓国語に対応し、高速な非自己回帰推論を実現します。
Voiceboxは、ローカル環境で動作するオープンソースのAI音声スタジオです。音声クローンやテキスト読み上げ、Whisperによる音声入力を備え、MCP経由でAIエージェントに音声出力機能を提供します。
Premove ITNは、英語の音声エージェント文字起こし向けのオープンソースの文脈対応逆テキスト正規化ツールです。DeBERTaによる文脈スコアリングを用いた生成・スコア・デコードのパイプラインで、ASR出力を正規な表記に変換します。
RunAnywhereは、スマートフォン、ブラウザ、デスクトップ、サーバーにわたって、AIモデルを完全にオンデバイスで実行するためのクロスプラットフォームSDKスイートです。LLM、ビジョン、音声、ボイスエージェント、RAG、エンベディング、画像生成を単一のセマンティックAPIでサポートします。