منصوبے کے بارے میں
Whisper ایک Transformer sequence-to-sequence ماڈل ہے جسے متنوع آڈیو کے ایک بڑے پیمانے کے ڈیٹا سیٹ پر تربیت دی گئی ہے۔ یہ ایک ملٹی ٹاسکنگ سسٹم کے طور پر کام کرتا ہے جو مختلف کاموں کو ٹوکنز کے ایک تسلسل کے طور پر مشترکہ طور پر ظاہر کر کے روایتی اسپیچ پروسیسنگ پائپ لائن کے متعدد مراحل کی جگہ لے سکتا ہے۔
اہم صلاحیتوں میں شامل ہیں:
- کثیر لسانی اسپیچ ریکگنیشن (transcription)
- انگریزی میں اسپیچ ترجمہ
- بولی جانے والی زبان کی شناخت
- Voice activity detection
یہ پروجیکٹ چھ ماڈل سائزز (tiny, base, small, medium, large, اور turbo) فراہم کرتا ہے تاکہ صارفین اپنے دستیاب VRAM کی بنیاد پر انفرنس اسپیڈ اور درستگی کے درمیان توازن برقرار رکھ سکیں۔ چھوٹے ماڈل سائزز کے لیے صرف انگریزی ورژن دستیاب ہیں۔
Whisper کو کمانڈ لائن انٹرفیس یا Python لائبریری کے طور پر استعمال کیا جا سکتا ہے۔ آڈیو پروسیسنگ کے لیے اسے ffmpeg کی ضرورت ہوتی ہے اور تیز ٹوکنائزیشن کے لیے یہ OpenAI کے tiktoken کا استعمال کرتا ہے۔