このプロジェクトについて

CrisperWhisper 2.0は、2つの文字起こしスタイルを呼び出しごとに明示的に選択できることを中心に設計された音声認識ツールキットです。逐語モードは、フィラー、繰り返し、言い直し、言い淀み、笑いなどの発声イベントを含め、実際に話された内容を一貫した形式で書き出します。意図モードは、話し手が意図した読みやすい清書版を生成し、数字、日付、メールアドレスを書き言葉として整形します。READMEでは、これをプロジェクトの中心的な設計判断として提示しています。ほとんどの音声認識システムは学習データから固定されたスタイルを継承しますが、本システムではそれをパラメータとして公開しています。 2つのモードに加えて、READMEでは教師付きクロスアテンションアライメントから得られる単語レベルのタイミングについて説明しており、プロジェクト自身のベンチマークでは、朗読音声で平均境界誤差約30ms、会話音声で41msと報告されています。「verbatimize」機能は、音声と既存の信頼できる清書文字起こしを受け取り、音声中に存在する非流暢性と発声イベントのみを挿入します。READMEでは、これを清書コーパスを逐語データセットに変換する方法として位置づけており、TTSデータ、臨床音声分析、データセット構築に利用できます。多言語の逐語モードと意図モードは、Whisperがサポートするほとんどの言語で動作するとされています。 長尺音声は、READMEが「条件付き継続」と呼ぶ方法で処理されます。各ウィンドウは既に文字起こしされた単語から継続するため、チャンク境界での単語の重複や欠落を回避し、タイムスタンプトークンの管理も不要になるとプロジェクトは述べています。CTranslate2ランタイムは、より小さなドラフトモデルによる投機的デコーディングを提供し、Whisperのループ繰り返し障害モードに対する幻覚緩和がデフォルトで有効になっているとREADMEには記載されています。 インストールには2つのエクストラがあります。Linux上のNVIDIA GPU向けのCTranslate2バックエンドと、macOS、Windows、CPU向けの純粋なPyTorchバックエンドです。初回ロード時にはHuggingFaceから重みをダウンロードし、ct2バックエンドではtorchとtransformersを必要とする一度限りの変換を実行します。モデルサイズはsmallからlarge、さらにturboまであり、追加の独自データで学習されホットワードブースティングをサポートする別の「Pro」ラインも用意されています。READMEには、1パスでのデュアルモード文字起こし、既存の文字起こしに対する強制アライメント、float16またはint8_float16量子化などのオプションも記載されています。 ライセンスは分割されています。リポジトリ内の推論コードはMITライセンスですが、モデルの重みは非商用研究ライセンスで公開されており、商用ライセンスは要望に応じて利用可能です。Proモデルは商用ライセンスのみです。READMEには、論文、完全なドキュメント、モデルページ、およびベンチマーク、多言語スタイル制御、アライナー、長尺継続、verbatimize、推論スタックを説明する複数の研究記事へのリンクがあります。README内のベンチマーク表はプロジェクト自身が報告した結果であり、そのように読むべきです。