عن المشروع

faster-whisper هو إعادة تنفيذ لنموذج OpenAI Whisper لتحويل الكلام إلى نص باستخدام محرك الاستدلال CTranslate2. تم تصميمه ليكون أكثر كفاءة من التنفيذ الأصلي، حيث يوفر سرعة نسخ تصل إلى 4 أضعاف مع استهلاك ذاكرة أقل. ويمكن تعزيز الكفاءة بشكل أكبر من خلال التكميم بـ 8 بت (8-bit quantization) على كل من CPU و GPU. تشمل القدرات الرئيسية ما يلي: - دعم أحجام مختلفة من النماذج، بما في ذلك التوافق مع نقاط تفتيش Distil-Whisper. - النسخ المجمع (Batched transcription) لزيادة الإنتاجية. - طوابع زمنية على مستوى الكلمة لمحاذاة صوتية دقيقة. - فلتر Silero VAD (كشف نشاط الصوت) مدمج لإزالة المقاطع غير الصوتية. - دعم أنواع حسابية متعددة (float16, int8_float16, int8) عبر أجهزة CUDA و CPU. - أداة تحويل لتحويل نماذج Whisper المتوافقة مع Transformers إلى تنسيق CTranslate2. على عكس Whisper الأصلي، يستخدم faster-whisper مكتبة PyAV لفك تشفير الصوت، مما يلغي الحاجة إلى تثبيت FFmpeg على مستوى النظام.