عن المشروع
Whisper هو نموذج Transformer sequence-to-sequence تم تدريبه على مجموعة بيانات واسعة النطاق من الملفات الصوتية المتنوعة. وهو يعمل كنظام متعدد المهام يمكنه استبدال مراحل متعددة من خط معالجة الكلام التقليدي من خلال تمثيل المهام المختلفة بشكل مشترك كسلسلة من الرموز (tokens).
تشمل القدرات الرئيسية ما يلي:
- التعرف على الكلام متعدد اللغات (النسخ)
- ترجمة الكلام إلى اللغة الإنجليزية
- تحديد اللغة المنطوقة
- اكتشاف النشاط الصوتي
يوفر المشروع ستة أحجام للنماذج (tiny، base، small، medium، large، و turbo) للسماح للمستخدمين بالموازنة بين سرعة الاستنتاج والدقة بناءً على ذاكرة VRAM المتاحة لديهم. تتوفر إصدارات مخصصة للغة الإنجليزية فقط لأحجام النماذج الأصغر.
يمكن استخدام Whisper عبر واجهة سطر الأوامر أو كمكتبة Python. ويتطلب ffmpeg لمعالجة الصوت ويستخدم tiktoken من OpenAI لترميز سريع.