Sobre el proyecto
Whisper es un modelo Transformer de secuencia a secuencia entrenado en un conjunto de datos a gran escala de audio diverso. Sirve como un sistema multitareas que puede reemplazar múltiples etapas de un flujo de procesamiento de voz tradicional al representar conjuntamente varias tareas como una secuencia de tokens.
Las capacidades clave incluyen:
- Reconocimiento de voz multilingüe (transcripción)
- Traducción de voz al inglés
- Identificación del idioma hablado
- Detección de actividad de voz
El proyecto ofrece seis tamaños de modelo (tiny, base, small, medium, large y turbo) para permitir que los usuarios equilibren la velocidad de inferencia y la precisión según su VRAM disponible. Hay versiones solo en inglés disponibles para los tamaños de modelo más pequeños.
Whisper se puede utilizar a través de una interfaz de línea de comandos o como una biblioteca de Python. Requiere ffmpeg para el procesamiento de audio y utiliza tiktoken de OpenAI para una tokenización rápida.