このプロジェクトについて

faster-whisperは、CTranslate2推論エンジンを利用したOpenAIのWhisper音声文字起こしモデルの再実装です。オリジナルの実装よりも効率的に設計されており、メモリ消費量を抑えつつ、最大4倍高速な文字起こしを提供します。CPUとGPUの両方で8ビット量子化を行うことで、効率をさらに高めることが可能です。 主な機能は以下の通りです: - Distil-Whisperチェックポイントとの互換性を含む、さまざまなモデルサイズをサポート。 - スループット向上のためのバッチ文字起こし。 - 正確なオーディオアライメントのための単語レベルのタイムスタンプ。 - 非音声セグメントを除去するための統合されたSilero VAD(音声活動検知)フィルタ。 - CUDAおよびCPUデバイスにおける複数の計算タイプ(float16, int8_float16, int8)をサポート。 - Transformers互換のWhisperモデルをCTranslate2形式に変換する変換ツール。 オリジナルのWhisperとは異なり、オーディオデコードにPyAVを使用しているため、システム全体へのFFmpegのインストールが不要です。