このプロジェクトについて
Whisperは、多様なオーディオからなる大規模データセットでトレーニングされたTransformer sequence-to-sequenceモデルです。さまざまなタスクをトークンのシーケンスとして共同で表現することで、従来の音声処理パイプラインの複数のステージを代替できるマルチタスクシステムとして機能します。
主な機能は以下の通りです:
- 多言語音声認識(文字起こし)
- 英語への音声翻訳
- 話されている言語の識別
- 音声活動検知(Voice activity detection)
本プロジェクトでは、利用可能なVRAMに基づいて推論速度と精度のバランスを調整できるよう、6つのモデルサイズ(tiny、base、small、medium、large、turbo)を提供しています。小規模なモデルサイズについては、英語専用バージョンも利用可能です。
Whisperは、コマンドラインインターフェースまたはPythonライブラリとして使用できます。オーディオ処理にはffmpegが必要であり、高速なトークナイゼーションのためにOpenAIのtiktokenを利用しています。