这个项目能做什么

faster-whisper 是利用 CTranslate2 推理引擎对 OpenAI Whisper 语音转文本模型的重新实现。其设计目标是比原始实现更高效,可提供高达 4 倍的转录速度,同时消耗更少的内存。通过在 CPU 和 GPU 上进行 8 位量化,可以进一步提升效率。 核心能力包括: - 支持多种模型尺寸,包括与 Distil-Whisper 检查点的兼容性。 - 支持批处理转录以提高吞吐量。 - 提供词级时间戳以实现精确的音频对齐。 - 集成 Silero VAD(语音活动检测)过滤器以移除非语音片段。 - 在 CUDA 和 CPU 设备上支持多种计算类型(float16, int8_float16, int8)。 - 提供将兼容 Transformers 的 Whisper 模型转换为 CTranslate2 格式的转换工具。 与原始 Whisper 不同,它使用 PyAV 进行音频解码,从而无需在系统中安装 FFmpeg。