Sobre el proyecto

faster-whisper es una reimplementación del modelo de texto a voz Whisper de OpenAI que utiliza el motor de inferencia CTranslate2. Está diseñado para ser más eficiente que la implementación original, proporcionando una transcripción hasta 4 veces más rápida mientras consume menos memoria. La eficiencia puede mejorarse aún más mediante la cuantización de 8 bits tanto en CPU como en GPU. Las capacidades clave incluyen: - Soporte para varios tamaños de modelo, incluyendo la compatibilidad con checkpoints de Distil-Whisper. - Transcripción por lotes (batched transcription) para aumentar el rendimiento. - Marcas de tiempo a nivel de palabra para una alineación de audio precisa. - Filtro Silero VAD (Voice Activity Detection) integrado para eliminar segmentos que no sean de voz. - Soporte para múltiples tipos de cómputo (float16, int8_float16, int8) en dispositivos CUDA y CPU. - Una herramienta de conversión para transformar modelos Whisper compatibles con Transformers al formato CTranslate2. A diferencia del Whisper original, utiliza PyAV para la decodificación de audio, eliminando el requisito de una instalación de FFmpeg en todo el sistema.