这个项目能做什么
Whisper 是一个 Transformer 序列到序列模型,在多样化的海量音频数据集上进行了训练。它作为一个多任务系统,通过将各种任务共同表示为一系列 token,可以替代传统语音处理流水线的多个阶段。
核心能力包括:
- 多语言语音识别(转录)
- 语音翻译成英文
- 口语语言识别
- 语音活动检测
该项目提供了六种模型尺寸(tiny, base, small, medium, large 和 turbo),允许用户根据可用的 VRAM 在推理速度和准确性之间取得平衡。较小尺寸的模型提供仅限英文的版本。
Whisper 可以通过命令行界面或作为 Python 库使用。它需要 ffmpeg 进行音频处理,并利用 OpenAI 的 tiktoken 实现快速分词。