À propos du projet

faster-whisper est une réimplémentation du modèle de reconnaissance vocale Whisper d'OpenAI utilisant le moteur d'inférence CTranslate2. Il est conçu pour être plus efficace que l'implémentation originale, offrant une transcription jusqu'à 4 fois plus rapide tout en consommant moins de mémoire. L'efficacité peut être encore améliorée grâce à la quantification 8 bits sur CPU et GPU. Les capacités clés incluent : - La prise en charge de diverses tailles de modèles, y compris la compatibilité avec les checkpoints Distil-Whisper. - La transcription par lots (batched transcription) pour augmenter le débit. - Des horodatages au niveau du mot pour un alignement audio précis. - Un filtre Silero VAD (Voice Activity Detection) intégré pour supprimer les segments sans parole. - La prise en charge de plusieurs types de calcul (float16, int8_float16, int8) sur les périphériques CUDA et CPU. - Un outil de conversion pour transformer les modèles Whisper compatibles Transformers au format CTranslate2. Contrairement au Whisper original, il utilise PyAV pour le décodage audio, supprimant ainsi la nécessité d'une installation système de FFmpeg.