इस प्रोजेक्ट के बारे में
Whisper एक Transformer sequence-to-sequence मॉडल है जिसे विविध ऑडियो के एक बड़े पैमाने के डेटासेट पर प्रशिक्षित किया गया है। यह एक मल्टीटास्किंग सिस्टम के रूप में कार्य करता है जो विभिन्न कार्यों को टोकन के अनुक्रम के रूप में संयुक्त रूप से प्रदर्शित करके पारंपरिक स्पीच-प्रोसेसिंग पाइपलाइन के कई चरणों को बदल सकता है।
मुख्य क्षमताओं में शामिल हैं:
- बहुभाषी स्पीच रिकग्निशन (ट्रांसक्रिप्शन)
- अंग्रेजी में स्पीच अनुवाद
- बोली जाने वाली भाषा की पहचान
- वॉयस एक्टिविटी डिटेक्शन
यह प्रोजेक्ट छह मॉडल साइज (tiny, base, small, medium, large, और turbo) प्रदान करता है ताकि उपयोगकर्ता अपने उपलब्ध VRAM के आधार पर इन्फरेंस स्पीड और सटीकता के बीच संतुलन बना सकें। छोटे मॉडल साइज के लिए केवल अंग्रेजी संस्करण उपलब्ध हैं।
Whisper का उपयोग कमांड-लाइन इंटरफेस या Python लाइब्रेरी के रूप में किया जा सकता है। इसे ऑडियो प्रोसेसिंग के लिए ffmpeg की आवश्यकता होती है और यह तेज़ टोकनाइज़ेशन के लिए OpenAI के tiktoken का उपयोग करता है।