这个项目能做什么

CrisperWhisper 2.0 是一个语音识别工具包,其核心设计是在每次调用时明确选择两种转录风格之一。逐字模式以一致的格式记录实际说出的内容,包括填充词、重复、截断、起句失误以及笑声等声音事件。意图模式则输出说话者本意的干净、可读版本,将数字、日期和电子邮件格式化为书面文本。README 将此作为项目的核心设计决策:大多数语音转文字系统从训练数据中继承固定风格,而本项目将其暴露为参数。 除两种模式外,README 描述了基于监督交叉注意力对齐的词级时间戳,在项目自身的基准测试中,朗读语音的平均边界误差约为 30 毫秒,对话语音约为 41 毫秒。"verbatimize" 功能接收音频和已有的可信干净转录,仅插入音频中存在的非流利现象和声音事件。README 将其定位为将干净语料转换为逐字数据集的方法,可用于 TTS 数据、临床语音分析和数据集构建。多语言逐字模式和意图模式据称适用于 Whisper 支持的大多数语言。 长音频通过 README 所称的条件续接处理:每个窗口从已转录的词语继续,项目称这避免了分块边界处的重复或遗漏词语,也避免了时间戳-词元簿记。CTranslate2 运行时提供使用较小草稿模型的推测解码,README 指出针对 Whisper 循环重复故障模式的幻觉缓解默认启用。 安装提供两种可选依赖:适用于 Linux 上 NVIDIA GPU 的 CTranslate2 后端,以及适用于 macOS、Windows 和 CPU 的纯 PyTorch 后端。首次加载会从 HuggingFace 下载权重,在 ct2 后端上会执行一次需要 torch 和 transformers 的一次性转换。模型规模从小型到大型,另有 turbo,以及单独的 "Pro" 系列,据描述在额外专有数据上训练并支持热词增强。README 还列出了单次双模式转录、现有转录的强制对齐以及 float16 或 int8_float16 量化等选项。 许可分为两部分:仓库中的推理代码采用 MIT 许可,模型权重则按非商业研究许可发布,商业许可可应要求获取;Pro 模型仅限商业许可。README 链接了论文、完整文档、模型页面以及多篇研究文章,解释了基准测试、多语言风格控制、对齐器、长音频续接、verbatimize 和推理栈。README 中的基准表格是项目自行报告的结果,应据此理解。