প্রকল্প সম্পর্কে
faster-whisper হলো CTranslate2 ইনফারেন্স ইঞ্জিন ব্যবহার করে তৈরি OpenAI-এর Whisper স্পিচ-টু-টেক্সট মডেলের একটি পুনঃবাস্তবায়ন। এটি মূল বাস্তবায়নের চেয়ে আরও দক্ষ হওয়ার জন্য ডিজাইন করা হয়েছে, যা কম মেমরি ব্যবহার করে ৪ গুণ পর্যন্ত দ্রুত ট্রান্সক্রিপশন প্রদান করে। CPU এবং GPU উভয়ের ক্ষেত্রেই 8-bit quantization-এর মাধ্যমে এর দক্ষতা আরও বৃদ্ধি করা সম্ভব।
এর প্রধান সক্ষমতাগুলোর মধ্যে রয়েছে:
- বিভিন্ন মডেল সাইজের সমর্থন, যার মধ্যে Distil-Whisper চেকপয়েন্টগুলোর সাথে সামঞ্জস্যতা অন্তর্ভুক্ত।
- থ্রুপুট বৃদ্ধির জন্য ব্যাচড ট্রান্সক্রিপশন।
- নিখুঁত অডিও অ্যালাইনমেন্টের জন্য শব্দ-স্তরের (word-level) টাইমস্ট্যাম্প।
- কথা নয় এমন অংশগুলো সরানোর জন্য সমন্বিত Silero VAD (Voice Activity Detection) ফিল্টার।
- CUDA এবং CPU ডিভাইসে একাধিক কম্পিউট টাইপ (float16, int8_float16, int8) সমর্থন।
- Transformers-সামঞ্জস্যপূর্ণ Whisper মডেলগুলোকে CTranslate2 ফরম্যাটে রূপান্তর করার জন্য একটি কনভার্সন টুল।
মূল Whisper-এর বিপরীতে, এটি অডিও ডিকোডিংয়ের জন্য PyAV ব্যবহার করে, যার ফলে সিস্টেম-ওয়াইড FFmpeg ইনস্টলেশনের প্রয়োজনীয়তা থাকে না।