À propos du projet

Whisper est un modèle Transformer sequence-to-sequence entraîné sur un ensemble de données audio diversifiées à grande échelle. Il sert de système multitâche capable de remplacer plusieurs étapes d'un pipeline traditionnel de traitement de la parole en représentant conjointement diverses tâches comme une séquence de jetons. Les capacités clés incluent : - La reconnaissance vocale multilingue (transcription) - La traduction vocale vers l'anglais - L'identification de la langue parlée - La détection d'activité vocale Le projet propose six tailles de modèles (tiny, base, small, medium, large et turbo) pour permettre aux utilisateurs d'équilibrer la vitesse d'inférence et la précision en fonction de leur VRAM disponible. Des versions exclusivement anglaises sont disponibles pour les tailles de modèles les plus petites. Whisper peut être utilisé via une interface en ligne de commande ou comme bibliothèque Python. Il nécessite ffmpeg pour le traitement audio et utilise tiktoken d'OpenAI pour une tokenisation rapide.