প্রকল্প সম্পর্কে

faster-whisper হলো CTranslate2 ইনফারেন্স ইঞ্জিন ব্যবহার করে তৈরি OpenAI-এর Whisper স্পিচ-টু-টেক্সট মডেলের একটি পুনঃবাস্তবায়ন। এটি মূল বাস্তবায়নের চেয়ে আরও দক্ষ হওয়ার জন্য ডিজাইন করা হয়েছে, যা কম মেমরি ব্যবহার করে ৪ গুণ পর্যন্ত দ্রুত ট্রান্সক্রিপশন প্রদান করে। CPU এবং GPU উভয়ের ক্ষেত্রেই 8-bit quantization-এর মাধ্যমে এর দক্ষতা আরও বৃদ্ধি করা সম্ভব। এর প্রধান সক্ষমতাগুলোর মধ্যে রয়েছে: - বিভিন্ন মডেল সাইজের সমর্থন, যার মধ্যে Distil-Whisper চেকপয়েন্টগুলোর সাথে সামঞ্জস্যতা অন্তর্ভুক্ত। - থ্রুপুট বৃদ্ধির জন্য ব্যাচড ট্রান্সক্রিপশন। - নিখুঁত অডিও অ্যালাইনমেন্টের জন্য শব্দ-স্তরের (word-level) টাইমস্ট্যাম্প। - কথা নয় এমন অংশগুলো সরানোর জন্য সমন্বিত Silero VAD (Voice Activity Detection) ফিল্টার। - CUDA এবং CPU ডিভাইসে একাধিক কম্পিউট টাইপ (float16, int8_float16, int8) সমর্থন। - Transformers-সামঞ্জস্যপূর্ণ Whisper মডেলগুলোকে CTranslate2 ফরম্যাটে রূপান্তর করার জন্য একটি কনভার্সন টুল। মূল Whisper-এর বিপরীতে, এটি অডিও ডিকোডিংয়ের জন্য PyAV ব্যবহার করে, যার ফলে সিস্টেম-ওয়াইড FFmpeg ইনস্টলেশনের প্রয়োজনীয়তা থাকে না।