منصوبے کے بارے میں
SpeechRecognition ایک وسیع پیمانے پر استعمال ہونے والی Python لائبریری ہے جو تقریر کی شناخت کے لیے ایک متحد انٹرفیس فراہم کرتی ہے، جس میں مختلف انجنوں اور APIs کی ایک وسیع رینج شامل ہے، آن لائن اور آف لائن دونوں۔ یہ مختلف اسپیچ ٹو ٹیکسٹ سروسز کے ساتھ انضمام کی پیچیدگی کو ختم کرتی ہے، جس سے ڈویلپرز کم سے کم کوڈ تبدیلیوں کے ساتھ فراہم کنندگان کے درمیان سوئچ کر سکتے ہیں۔
معاون انجنوں اور APIs میں CMU Sphinx (آف لائن)، Google Speech Recognition، Google Cloud Speech API، Wit.ai، Microsoft Azure Speech، Houndify API، IBM Speech to Text، Snowboy Hotword Detection (آف لائن)، TensorFlow، Vosk API (آف لائن)، OpenAI Whisper (آف لائن)، OpenAI Transcription API (بشمول OpenAI کے مطابق خود میزبان اینڈ پوائنٹس جیسے vLLM اور Ollama)، Groq Whisper API، اور Cohere Transcribe API شامل ہیں۔
لائبریری کو Python 3.10 یا اس سے نئے ورژن کی ضرورت ہے۔ اختیاری انحصار pip extras کے ذریعے نصب کیے جاتے ہیں: مائیکروفون ان پٹ کے لیے PyAudio، Sphinx شناخت کنندہ کے لیے PocketSphinx، Google Cloud Speech-to-Text کے لیے google-cloud-speech، آف لائن شناخت کے لیے Vosk، مقامی ٹرانسکرپشن کے لیے Whisper یا Faster Whisper، OpenAI Transcription API کے لیے openai، Groq Whisper API کے لیے groq، اور Cohere Transcribe API کے لیے cohere۔ x86 پر مبنی Windows، Linux، اور OS X سسٹمز کے لیے ایک FLAC انکوڈر شامل ہے لیکن دوسرے پلیٹ فارمز پر اسے الگ سے نصب کرنا ضروری ہے۔
اہم خصوصیات میں مائیکروفون پر مبنی تقریر کی گرفت، آڈیو فائل ٹرانسکرپشن، پس منظر میں سننا، محیطی شور کے لیے توانائی کی حد کیلیبریشن، اور توسیعی شناخت کے نتائج شامل ہیں۔ لائبریری ایک سادہ API فراہم کرتی ہے جس میں recognize_sphinx، recognize_google، recognize_google_cloud، recognize_wit، recognize_api، recognize_houndify، recognize_ibm، recognize_snowboy، recognize_tensorflow، recognize_vosk، recognize_whisper، recognize_faster_whisper، recognize_openai، recognize_groq، اور recognize_cohere_api جیسے طریقے شامل ہیں۔
ریپوزٹری میں ایک جامع مثالیں ڈائرکٹری شامل ہے جس میں مائیکروفون کی شناخت، آڈیو فائل ٹرانسکرپشن، آڈیو ڈیٹا محفوظ کرنے، توسیعی نتائج، توانائی کی حد کیلیبریشن، پس منظر میں سننے، اور خصوصی شناخت کنندہ کی خصوصیات کے استعمال کے نمونے ہیں۔ ٹربل شوٹنگ دستاویزات عام مسائل جیسے جھوٹے ٹرگرز، زبان/بولی کی حمایت، Raspberry Pi مائیکروفون کے مسائل، PyInstaller مطابقت، اور پلیٹ فارم کے مخصوص آڈیو خرابیوں کا احاطہ کرتی ہیں۔
لائبریری PyPI پر شائع ہوتی ہے اور متعدد مصنفین کے تعاون سے فعال طور پر برقرار رکھی جاتی ہے۔ یہ ڈویلپرز کے لیے موزوں ہے جو آواز سے چلنے والی ایپلیکیشنز، ٹرانسکرپشن ٹولز، اور تقریر سے چلنے والے انٹرفیس بنا رہے ہیں جنہیں کلاؤڈ بیسڈ اور ڈیوائس پر تقریر کی شناخت کے حل کے درمیان انتخاب کرنے میں لچک کی ضرورت ہوتی ہے۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.