इस प्रोजेक्ट के बारे में
SpeechRecognition एक व्यापक रूप से उपयोग की जाने वाली Python लाइब्रेरी है जो विभिन्न इंजनों और APIs, ऑनलाइन और ऑफलाइन दोनों, में वाक् पहचान करने के लिए एक एकीकृत इंटरफ़ेस प्रदान करती है। यह विभिन्न स्पीच-टू-टेक्स्ट सेवाओं के साथ एकीकरण की जटिलता को दूर करती है, जिससे डेवलपर्स न्यूनतम कोड परिवर्तनों के साथ प्रदाताओं के बीच स्विच कर सकते हैं।
समर्थित इंजन और APIs में CMU Sphinx (ऑफलाइन), Google Speech Recognition, Google Cloud Speech API, Wit.ai, Microsoft Azure Speech, Houndify API, IBM Speech to Text, Snowboy Hotword Detection (ऑफलाइन), TensorFlow, Vosk API (ऑफलाइन), OpenAI Whisper (ऑफलाइन), OpenAI Transcription API (जिसमें vLLM और Ollama जैसे OpenAI-संगत सेल्फ-होस्टेड एंडपॉइंट शामिल हैं), Groq Whisper API, और Cohere Transcribe API शामिल हैं।
इस लाइब्रेरी को Python 3.10 या उसके बाद के संस्करण की आवश्यकता है। वैकल्पिक निर्भरताएँ pip extras के माध्यम से स्थापित की जाती हैं: माइक्रोफ़ोन इनपुट के लिए PyAudio, Sphinx recognizer के लिए PocketSphinx, Google Cloud Speech-to-Text के लिए google-cloud-speech, ऑफलाइन पहचान के लिए Vosk, स्थानीय ट्रांसक्रिप्शन के लिए Whisper या Faster Whisper, OpenAI Transcription API के लिए openai, Groq Whisper API के लिए groq, और Cohere Transcribe API के लिए cohere। एक FLAC एन्कोडर x86-आधारित Windows, Linux, और OS X सिस्टम के लिए बंडल किया जाता है, लेकिन अन्य प्लेटफार्मों पर इसे अलग से स्थापित किया जाना चाहिए।
मुख्य विशेषताओं में माइक्रोफ़ोन-आधारित वाक् कैप्चर, ऑडियो फ़ाइल ट्रांसक्रिप्शन, बैकग्राउंड सुनना, परिवेशी शोर के लिए ऊर्जा थ्रेशोल्ड अंशांकन, और विस्तारित पहचान परिणाम शामिल हैं। यह लाइब्रेरी सरल API प्रदान करती है जिसमें recognize_sphinx, recognize_google, recognize_google_cloud, recognize_wit, recognize_api, recognize_houndify, recognize_ibm, recognize_snowboy, recognize_tensorflow, recognize_vosk, recognize_whisper, recognize_faster_whisper, recognize_openai, recognize_groq, और recognize_cohere_api जैसी विधियाँ शामिल हैं।
रिपॉजिटरी में एक व्यापक उदाहरण निर्देशिका शामिल है जिसमें माइक्रोफ़ोन पहचान, ऑडियो फ़ाइल ट्रांसक्रिप्शन, ऑडियो डेटा सहेजना, विस्तारित परिणाम, ऊर्जा थ्रेशोल्ड अंशांकन, बैकग्राउंड सुनना, और विशेष पहचानकर्ता सुविधाओं के उपयोग के पैटर्न शामिल हैं। समस्या निवारण दस्तावेज़ीकरण सामान्य मुद्दों जैसे गलत ट्रिगर, भाषा/बोली समर्थन, Raspberry Pi माइक्रोफ़ोन समस्याएँ, PyInstaller संगतता, और प्लेटफ़ॉर्म-विशिष्ट ऑडियो त्रुटियों को कवर करता है।
यह लाइब्रेरी PyPI पर प्रकाशित है और एकाधिक लेखकों के योगदान के साथ सक्रिय रूप से बनाए रखी जाती है। यह उन डेवलपर्स के लिए उपयुक्त है जो वॉयस-सक्षम अनुप्रयोगों, ट्रांसक्रिप्शन टूल्स, और स्पीच-संचालित इंटरफेस का निर्माण कर रहे हैं, जिन्हें क्लाउड-आधारित और ऑन-डिवाइस वाक् पहचान समाधानों के बीच चयन करने में लचीलापन चाहिए।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.