Sobre o projeto

faster-whisper é uma reimplementação do modelo de fala para texto Whisper da OpenAI utilizando o mecanismo de inferência CTranslate2. Ele foi projetado para ser mais eficiente que a implementação original, proporcionando transcrições até 4 vezes mais rápidas enquanto consome menos memória. A eficiência pode ser ainda mais aprimorada através de quantização de 8 bits tanto em CPU quanto em GPU. As principais capacidades incluem: - Suporte para vários tamanhos de modelo, incluindo compatibilidade com checkpoints do Distil-Whisper. - Transcrição em lote (batched) para maior rendimento. - Timestamps ao nível de palavra para alinhamento preciso do áudio. - Filtro Silero VAD (Voice Activity Detection) integrado para remover segmentos sem fala. - Suporte para múltiplos tipos de computação (float16, int8_float16, int8) em dispositivos CUDA e CPU. - Uma ferramenta de conversão para transformar modelos Whisper compatíveis com Transformers para o formato CTranslate2. Ao contrário do Whisper original, ele utiliza PyAV para decodificação de áudio, removendo a necessidade de uma instalação do FFmpeg em todo o sistema.