Об этом проекте

faster-whisper — это переработка модели преобразования речи в текст OpenAI Whisper с использованием движка вывода CTranslate2. Она разработана для большей эффективности по сравнению с оригинальной реализацией, обеспечивая ускорение транскрибации до 4 раз при меньшем потреблении памяти. Эффективность может быть дополнительно повышена за счет 8-битного квантования как на CPU, так и на GPU. Ключевые возможности включают: - Поддержку различных размеров моделей, включая совместимость с чекпоинтами Distil-Whisper. - Пакетную транскрибацию для увеличения пропускной способности. - Временные метки на уровне слов для точного выравнивания аудио. - Интегрированный фильтр Silero VAD (Voice Activity Detection) для удаления сегментов без речи. - Поддержку нескольких типов вычислений (float16, int8_float16, int8) для устройств CUDA и CPU. - Инструмент конвертации для преобразования совместимых с Transformers моделей Whisper в формат CTranslate2. В отличие от оригинального Whisper, здесь используется PyAV для декодирования аудио, что устраняет необходимость в системной установке FFmpeg.