このプロジェクトについて

Whisperは、多様なオーディオからなる大規模データセットでトレーニングされたTransformer sequence-to-sequenceモデルです。さまざまなタスクをトークンのシーケンスとして共同で表現することで、従来の音声処理パイプラインの複数のステージを代替できるマルチタスクシステムとして機能します。 主な機能は以下の通りです: - 多言語音声認識(文字起こし) - 英語への音声翻訳 - 話されている言語の識別 - 音声活動検知(Voice activity detection) 本プロジェクトでは、利用可能なVRAMに基づいて推論速度と精度のバランスを調整できるよう、6つのモデルサイズ(tiny、base、small、medium、large、turbo)を提供しています。小規模なモデルサイズについては、英語専用バージョンも利用可能です。 Whisperは、コマンドラインインターフェースまたはPythonライブラリとして使用できます。オーディオ処理にはffmpegが必要であり、高速なトークナイゼーションのためにOpenAIのtiktokenを利用しています。