इस प्रोजेक्ट के बारे में
faster-whisper, CTranslate2 इन्फरेंस इंजन का उपयोग करने वाला OpenAI के Whisper स्पीच-टू-टेक्स्ट मॉडल का एक पुन: कार्यान्वयन है। इसे मूल कार्यान्वयन की तुलना में अधिक कुशल बनाने के लिए डिज़ाइन किया गया है, जो कम मेमोरी की खपत करते हुए 4 गुना तक तेज़ ट्रांसक्रिप्शन प्रदान करता है। CPU और GPU दोनों पर 8-बिट क्वांटाइजेशन के माध्यम से दक्षता को और बढ़ाया जा सकता है।
मुख्य क्षमताओं में शामिल हैं:
- विभिन्न मॉडल आकारों के लिए समर्थन, जिसमें Distil-Whisper चेकपॉइंट्स के साथ संगतता शामिल है।
- बढ़ी हुई थ्रूपुट के लिए बैच्ड ट्रांसक्रिप्शन।
- सटीक ऑडियो एलाइनमेंट के लिए शब्द-स्तर के टाइमस्टैम्प।
- गैर-भाषण खंडों को हटाने के लिए एकीकृत Silero VAD (Voice Activity Detection) फ़िल्टर।
- CUDA और CPU डिवाइसों पर कई कंप्यूट प्रकारों (float16, int8_float16, int8) का समर्थन।
- Transformers-संगत Whisper मॉडल को CTranslate2 प्रारूप में बदलने के लिए एक रूपांतरण टूल।
मूल Whisper के विपरीत, यह ऑडियो डिकोडिंग के लिए PyAV का उपयोग करता है, जिससे सिस्टम-व्यापी FFmpeg इंस्टॉलेशन की आवश्यकता समाप्त हो जाती है।