OPEN SOURCE, OPEN TO EVERYONE

オープンソース。新しい可能性。

優れたオープンソースプロジェクトを見つけ、匿名でプロジェクトを投稿し、自分のプロジェクトを申請して編集できます。

編集部選定 · 良いオープンソースを発見4109発見済み

好奇心とともに、オープンソースの世界へ。

THE FIRST COLLECTION
Topic: speech-recognition清除
talkbank-toolsFranklinChen
新着

Batchalign3は、CHATトランスクリプトの作成と拡充のためのTalkBankオーディオおよびMLパイプラインであり、ASR、強制アライメント、ニューラル形態論タグ付け、翻訳、発話セグメンテーションをカバーしています。CLI、Pythonパッケージ、PyO3ブリッジ、Reactダッシュボード、実験的なTauriデスクトップシェルを提供します。

人工知能開発ツールModel runtime
新着

SpeechRecognitionは、オンライン/オフラインの多様なエンジンやAPIをサポートするPython音声認識ライブラリ。CMU Sphinx、Google、Azure、IBM、Vosk、Whisper、OpenAIなどに対応。

人工知能開発ツールMultimodal AI
premove-itnpremove-ai
新着

Premove ITNは、英語の音声エージェント文字起こし向けのオープンソースの文脈対応逆テキスト正規化ツールです。DeBERTaによる文脈スコアリングを用いた生成・スコア・デコードのパイプラインで、ASR出力を正規な表記に変換します。

人工知能開発ツールModel runtime
transformershuggingface
新着

Hugging Face Transformersは、テキスト、ビジョン、オーディオ、マルチモーダルタスクに対応した機械学習用モデル定義フレームワークです。100万以上の学習済みチェックポイントを備え、推論と学習のための統一APIを提供します。

人工知能開発ツールTraining & evaluation
sensevoiceQwenAudio
新着

SenseVoiceSmallは、ASR、言語識別、感情認識、音声イベント検出を備えたオープンソースの音声基盤モデルで、中国語、広東語、英語、日本語、韓国語に対応し、高速な非自己回帰推論を実現します。

人工知能開発ツールModel runtime
espnetespnet
新着

ESPnetはPyTorchベースのエンドツーエンド音声処理ツールキットで、ASR、TTS、音声翻訳、強調、話者分離など幅広いタスクをカバーし、再現可能なレシピと事前学習モデルを提供します。

人工知能開発ツールModel runtime
whisperlivekitQuentinFuxa
新着

WhisperLiveKitは、自己ホスト型で超ローレイテンシーな音声認識パイプラインです。WebSocketおよびOpenAI/Deepgram互換APIを介し、リアルタイム文字起こし、話者分離、翻訳を提供します。

人工知能開発ツールModel runtime