منصوبے کے بارے میں
faster-whisper، OpenAI کے Whisper اسپیچ-ٹو-ٹیکسٹ ماڈل کا ایک نیا ورژن ہے جو CTranslate2 انفرنس انجن کا استعمال کرتا ہے۔ اسے اصل ورژن کے مقابلے میں زیادہ موثر بنانے کے لیے ڈیزائن کیا گیا ہے، جو کم میموری استعمال کرتے ہوئے 4 گنا تک تیز ترانسکرپشن فراہم کرتا ہے۔ CPU اور GPU دونوں پر 8-bit quantization کے ذریعے اس کی کارکردگی کو مزید بہتر بنایا جا سکتا ہے۔
اہم صلاحیتوں میں شامل ہیں:
- مختلف ماڈل سائزز کی سپورٹ، بشمول Distil-Whisper checkpoints کے ساتھ مطابقت۔
- تھرو پٹ بڑھانے کے لیے Batched transcription۔
- درست آڈیو الائنمنٹ کے لیے لفظ کی سطح کے ٹائم اسٹیمپس (Word-level timestamps)۔
- غیر تقریری حصوں کو ہٹانے کے لیے مربوط Silero VAD (Voice Activity Detection) فلٹر۔
- CUDA اور CPU ڈیوائسز پر متعدد کمپیوٹ ٹائپس (float16, int8_float16, int8) کی سپورٹ۔
- Transformers کے ساتھ مطابقت رکھنے والے Whisper ماڈلز کو CTranslate2 فارمیٹ میں تبدیل کرنے کے لیے ایک کنورژن ٹول۔
اصل Whisper کے برعکس، یہ آڈیو ڈی کوڈنگ کے لیے PyAV کا استعمال کرتا ہے، جس سے سسٹم میں FFmpeg کی انسٹالیشن کی ضرورت ختم ہو جاتی ہے۔