このプロジェクトについて

Premove ITNは、英語の音声エージェント文字起こし向けに設計された、オープンソースで文脈対応の逆テキスト正規化(ITN)ライブラリです。電話番号、メールアドレス、識別子、日付、時刻、金額、測定値、英数字コードなどの構造化された値について、音声ASR(自動音声認識)出力を正規な表記形式に変換します。 Premove ITNが対処する中核的な課題は、話し言葉の曖昧さです。例えば、「one oh five」は識別子の105、時刻の1:05、またはまったく別のものを意味する可能性があります。従来のルールベースのシステムでは、話者が意図した解釈を常に判断できるとは限りません。Premove ITNは、文脈対応のスコアリングを使用して正しい表記形式を選択することで、この問題を解決します。 アーキテクチャは、生成、スコア、デコードの3段階のパイプラインに従います。まず、Rustベースの実現レイヤーが、音声テキストのスパンに対して有効なすべての表記形式を列挙します。次に、DeBERTa-v3-largeコンテキストスコアラー(435.6Mパラメータ)がトランスクリプトを一度エンコードし、コンテキストのソーススパン、候補の種類ラベル、提案された置換に基づいて各候補をスコアリングします。最後に、正確な動的プログラミングデコーダーが、重複する候補を処理しながら、トランスクリプトを通る最高スコアの互換性のあるパスを見つけます。 サポートされる形式には、数字、数字列、時刻、日付、金額、小数、測定値、序数、電話番号、メールとURL、バージョンと識別子、句読点、略語が含まれます。このツールは英語のみに対応しており、非英語の音声、住所、自由形式の書き換え、または任意のアプリケーション固有の形式に対するファーストクラスの正規化は提供しません。 専用の400行の音声エージェントサブセットを含む1,500行の固定ベンチマークで、Premove ITNは音声エージェントサブセットで99.50%の意味的正確さを達成しており、text-processing-rsの68.25%、NVIDIA Thutmoseの67.00%と比較されます。このベンチマークは、トレーニングとチェックポイント選択から除外された合成ストレステストスイートです。 このツールは、PyPIのPythonパッケージ(premove-itn)として配布され、モデルの重みはHugging Face(premove-ai/premove-itn)でホストされています。現在のリリースはv0.2.0です。モデルの読み込みはコストがかかります(初期化に数秒、最初のダウンロードは約1.6 GB)が、ウォーム状態での正規化呼び出しは高速です(Apple M4 MacBook Airで平均ウォームレイテンシ56.49 ms)。 制限には、英語のみのサポート、決定論的なRust実現器による正規化の制限、512 DeBERTaトークンを超える入力の拒否、CUDA、Windows、macOS Intel、Linux ARM64、その他のアクセラレータの未検証サポートが含まれます。 ソースコードとモデルの重みはMITライセンスです。コンテキストスコアラーはエンコーダーバックボーンとしてmicrosoft/deberta-v3-largeを使用し、Rust実現レイヤーはtext-processing-rs(Apache-2.0ライセンス)を使用しています。