عن المشروع
faster-whisper هو إعادة تنفيذ لنموذج OpenAI Whisper لتحويل الكلام إلى نص باستخدام محرك الاستدلال CTranslate2. تم تصميمه ليكون أكثر كفاءة من التنفيذ الأصلي، حيث يوفر سرعة نسخ تصل إلى 4 أضعاف مع استهلاك ذاكرة أقل. ويمكن تعزيز الكفاءة بشكل أكبر من خلال التكميم بـ 8 بت (8-bit quantization) على كل من CPU و GPU.
تشمل القدرات الرئيسية ما يلي:
- دعم أحجام مختلفة من النماذج، بما في ذلك التوافق مع نقاط تفتيش Distil-Whisper.
- النسخ المجمع (Batched transcription) لزيادة الإنتاجية.
- طوابع زمنية على مستوى الكلمة لمحاذاة صوتية دقيقة.
- فلتر Silero VAD (كشف نشاط الصوت) مدمج لإزالة المقاطع غير الصوتية.
- دعم أنواع حسابية متعددة (float16, int8_float16, int8) عبر أجهزة CUDA و CPU.
- أداة تحويل لتحويل نماذج Whisper المتوافقة مع Transformers إلى تنسيق CTranslate2.
على عكس Whisper الأصلي، يستخدم faster-whisper مكتبة PyAV لفك تشفير الصوت، مما يلغي الحاجة إلى تثبيت FFmpeg على مستوى النظام.