Об этом проекте
faster-whisper — это переработка модели преобразования речи в текст OpenAI Whisper с использованием движка вывода CTranslate2. Она разработана для большей эффективности по сравнению с оригинальной реализацией, обеспечивая ускорение транскрибации до 4 раз при меньшем потреблении памяти. Эффективность может быть дополнительно повышена за счет 8-битного квантования как на CPU, так и на GPU.
Ключевые возможности включают:
- Поддержку различных размеров моделей, включая совместимость с чекпоинтами Distil-Whisper.
- Пакетную транскрибацию для увеличения пропускной способности.
- Временные метки на уровне слов для точного выравнивания аудио.
- Интегрированный фильтр Silero VAD (Voice Activity Detection) для удаления сегментов без речи.
- Поддержку нескольких типов вычислений (float16, int8_float16, int8) для устройств CUDA и CPU.
- Инструмент конвертации для преобразования совместимых с Transformers моделей Whisper в формат CTranslate2.
В отличие от оригинального Whisper, здесь используется PyAV для декодирования аудио, что устраняет необходимость в системной установке FFmpeg.