عن المشروع
SpeechRecognition هي مكتبة بايثون واسعة الاستخدام توفر واجهة موحدة لإجراء التعرف على الكلام عبر مجموعة واسعة من المحركات وواجهات برمجة التطبيقات، سواء عبر الإنترنت أو دون اتصال. وهي تجرد التعقيد المرتبط بالتكامل مع خدمات تحويل الكلام إلى نص المختلفة، مما يسمح للمطورين بالتبديل بين المزودين بأقل تغييرات في الكود.
تشمل المحركات وواجهات برمجة التطبيقات المدعومة CMU Sphinx (دون اتصال)، وGoogle Speech Recognition، وGoogle Cloud Speech API، وWit.ai، وMicrosoft Azure Speech، وHoundify API، وIBM Speech to Text، وSnowboy Hotword Detection (دون اتصال)، وTensorFlow، وVosk API (دون اتصال)، وOpenAI Whisper (دون اتصال)، وOpenAI Transcription API (بما في ذلك نقاط النهاية المستضافة ذاتيًا المتوافقة مع OpenAI مثل vLLM وOllama)، وGroq Whisper API، وCohere Transcribe API.
تتطلب المكتبة Python 3.10 أو أحدث. يتم تثبيت التبعيات الاختيارية عبر إضافات pip: PyAudio لإدخال الميكروفون، وPocketSphinx لمحرك التعرف Sphinx، وgoogle-cloud-speech لـ Google Cloud Speech-to-Text، وVosk للتعرف دون اتصال، وWhisper أو Faster Whisper للنسخ المحلي، وopenai لـ OpenAI Transcription API، وgroq لـ Groq Whisper API، وcohere لـ Cohere Transcribe API. يتم تضمين مُرمِّز FLAC للأنظمة x86-based Windows وLinux وOS X، ولكن يجب تثبيته بشكل منفصل على الأنظمة الأساسية الأخرى.
تشمل الميزات الرئيسية التقاط الكلام عبر الميكروفون، ونسخ ملفات الصوت، والاستماع في الخلفية، ومعايرة عتبة الطاقة للضوضاء المحيطة، ونتائج التعرف الموسعة. توفر المكتبة واجهة برمجة تطبيقات بسيطة مع طرق مثل recognize_sphinx، وrecognize_google، وrecognize_google_cloud، وrecognize_wit، وrecognize_api، وrecognize_houndify، وrecognize_ibm، وrecognize_snowboy، وrecognize_tensorflow، وrecognize_vosk، وrecognize_whisper، وrecognize_faster_whisper، وrecognize_openai، وrecognize_groq، وrecognize_cohere_api.
يتضمن المستودع دليل أمثلة شاملًا مع أنماط الاستخدام للتعرف عبر الميكروفون، ونسخ ملفات الصوت، وحفظ بيانات الصوت، والنتائج الموسعة، ومعايرة عتبة الطاقة، والاستماع في الخلفية، وميزات محرك التعرف الخاصة. تغطي وثائق استكشاف الأخطاء وإصلاحها المشكلات الشائعة مثل التشغيل الخاطئ، ودعم اللغة/اللهجة، ومشكلات ميكروفون Raspberry Pi، والتوافق مع PyInstaller، وأخطاء الصوت الخاصة بالمنصة.
تم نشر المكتبة على PyPI ويتم صيانتها بنشاط بمساهمات من عدة مؤلفين. وهي مناسبة للمطورين الذين يبنون تطبيقات ممكّنة صوتيًا، وأدوات النسخ، وواجهات مدفوعة بالكلام الذين يحتاجون إلى المرونة في الاختيار بين حلول التعرف على الكلام السحابية وعلى الجهاز.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.