Sobre el proyecto
faster-whisper es una reimplementación del modelo de texto a voz Whisper de OpenAI que utiliza el motor de inferencia CTranslate2. Está diseñado para ser más eficiente que la implementación original, proporcionando una transcripción hasta 4 veces más rápida mientras consume menos memoria. La eficiencia puede mejorarse aún más mediante la cuantización de 8 bits tanto en CPU como en GPU.
Las capacidades clave incluyen:
- Soporte para varios tamaños de modelo, incluyendo la compatibilidad con checkpoints de Distil-Whisper.
- Transcripción por lotes (batched transcription) para aumentar el rendimiento.
- Marcas de tiempo a nivel de palabra para una alineación de audio precisa.
- Filtro Silero VAD (Voice Activity Detection) integrado para eliminar segmentos que no sean de voz.
- Soporte para múltiples tipos de cómputo (float16, int8_float16, int8) en dispositivos CUDA y CPU.
- Una herramienta de conversión para transformar modelos Whisper compatibles con Transformers al formato CTranslate2.
A diferencia del Whisper original, utiliza PyAV para la decodificación de audio, eliminando el requisito de una instalación de FFmpeg en todo el sistema.