Об этом проекте
Whisper представляет собой модель Transformer sequence-to-sequence, обученную на масштабном наборе разнообразных аудиоданных. Она функционирует как многозадачная система, которая может заменить несколько этапов традиционного конвейера обработки речи, совместно представляя различные задачи в виде последовательности токенов.
Ключевые возможности включают:
- Многоязычное распознавание речи (транскрибация)
- Перевод речи на английский язык
- Идентификация разговорного языка
- Детекция голосовой активности
Проект предоставляет шесть размеров моделей (tiny, base, small, medium, large и turbo), что позволяет пользователям балансировать между скоростью вывода и точностью в зависимости от доступного объема VRAM. Для моделей меньшего размера доступны версии только для английского языка.
Whisper можно использовать через интерфейс командной строки или как библиотеку Python. Для обработки аудио требуется ffmpeg, а для быстрой токенизации используется tiktoken от OpenAI.