这个项目能做什么

Whisper 是一个 Transformer 序列到序列模型,在多样化的海量音频数据集上进行了训练。它作为一个多任务系统,通过将各种任务共同表示为一系列 token,可以替代传统语音处理流水线的多个阶段。 核心能力包括: - 多语言语音识别(转录) - 语音翻译成英文 - 口语语言识别 - 语音活动检测 该项目提供了六种模型尺寸(tiny, base, small, medium, large 和 turbo),允许用户根据可用的 VRAM 在推理速度和准确性之间取得平衡。较小尺寸的模型提供仅限英文的版本。 Whisper 可以通过命令行界面或作为 Python 库使用。它需要 ffmpeg 进行音频处理,并利用 OpenAI 的 tiktoken 实现快速分词。