このプロジェクトについて
faster-whisperは、CTranslate2推論エンジンを利用したOpenAIのWhisper音声文字起こしモデルの再実装です。オリジナルの実装よりも効率的に設計されており、メモリ消費量を抑えつつ、最大4倍高速な文字起こしを提供します。CPUとGPUの両方で8ビット量子化を行うことで、効率をさらに高めることが可能です。
主な機能は以下の通りです:
- Distil-Whisperチェックポイントとの互換性を含む、さまざまなモデルサイズをサポート。
- スループット向上のためのバッチ文字起こし。
- 正確なオーディオアライメントのための単語レベルのタイムスタンプ。
- 非音声セグメントを除去するための統合されたSilero VAD(音声活動検知)フィルタ。
- CUDAおよびCPUデバイスにおける複数の計算タイプ(float16, int8_float16, int8)をサポート。
- Transformers互換のWhisperモデルをCTranslate2形式に変換する変換ツール。
オリジナルのWhisperとは異なり、オーディオデコードにPyAVを使用しているため、システム全体へのFFmpegのインストールが不要です。