Sobre o projeto
Whisper é um modelo Transformer sequence-to-sequence treinado em um conjunto de dados de larga escala de áudios diversos. Ele serve como um sistema multitarefa que pode substituir múltiplas etapas de um pipeline tradicional de processamento de fala, representando conjuntamente várias tarefas como uma sequência de tokens.
As principais capacidades incluem:
- Reconhecimento de fala multilíngue (transcrição)
- Tradução de fala para inglês
- Identificação de idioma falado
- Detecção de atividade de voz
O projeto oferece seis tamanhos de modelo (tiny, base, small, medium, large e turbo) para permitir que os usuários equilibrem a velocidade de inferência e a precisão com base em sua VRAM disponível. Versões apenas em inglês estão disponíveis para os tamanhos de modelo menores.
Whisper pode ser usado via interface de linha de comando ou como uma biblioteca Python. Ele requer ffmpeg para processamento de áudio e utiliza o tiktoken da OpenAI para tokenização rápida.