À propos du projet

SpeechRecognition est une bibliothèque Python largement utilisée qui fournit une interface unifiée pour effectuer la reconnaissance vocale sur une large gamme de moteurs et d'API, en ligne et hors ligne. Elle abstrait la complexité de l'intégration avec différents services de synthèse vocale, permettant aux développeurs de changer de fournisseur avec un minimum de modifications de code. Les moteurs et API pris en charge incluent CMU Sphinx (hors ligne), Google Speech Recognition, Google Cloud Speech API, Wit.ai, Microsoft Azure Speech, Houndify API, IBM Speech to Text, Snowboy Hotword Detection (hors ligne), TensorFlow, Vosk API (hors ligne), OpenAI Whisper (hors ligne), OpenAI Transcription API (y compris les points de terminaison auto-hébergés compatibles OpenAI tels que vLLM et Ollama), Groq Whisper API et Cohere Transcribe API. La bibliothèque nécessite Python 3.10 ou version ultérieure. Les dépendances optionnelles sont installées via des extras pip : PyAudio pour l'entrée microphone, PocketSphinx pour le reconnaisseur Sphinx, google-cloud-speech pour Google Cloud Speech-to-Text, Vosk pour la reconnaissance hors ligne, Whisper ou Faster Whisper pour la transcription locale, openai pour l'API de transcription OpenAI, groq pour l'API Groq Whisper et cohere pour l'API Cohere Transcribe. Un encodeur FLAC est inclus pour les systèmes Windows, Linux et OS X basés sur x86, mais doit être installé séparément sur d'autres plateformes. Les fonctionnalités clés incluent la capture vocale basée sur microphone, la transcription de fichiers audio, l'écoute en arrière-plan, l'étalonnage du seuil d'énergie pour le bruit ambiant et les résultats de reconnaissance étendus. La bibliothèque fournit une API simple avec des méthodes telles que recognize_sphinx, recognize_google, recognize_google_cloud, recognize_wit, recognize_api, recognize_houndify, recognize_ibm, recognize_snowboy, recognize_tensorflow, recognize_vosk, recognize_whisper, recognize_faster_whisper, recognize_openai, recognize_groq et recognize_cohere_api. Le dépôt comprend un répertoire d'exemples complet avec des modèles d'utilisation pour la reconnaissance par microphone, la transcription de fichiers audio, l'enregistrement de données audio, les résultats étendus, l'étalonnage du seuil d'énergie, l'écoute en arrière-plan et les fonctionnalités spéciales du reconnaisseur. La documentation de dépannage couvre les problèmes courants tels que les déclenchements faux, la prise en charge des langues et dialectes, les problèmes de microphone Raspberry Pi, la compatibilité PyInstaller et les erreurs audio spécifiques à la plateforme. La bibliothèque est publiée sur PyPI et est activement maintenue avec des contributions de plusieurs auteurs. Elle convient aux développeurs créant des applications vocales, des outils de transcription et des interfaces pilotées par la parole qui ont besoin de flexibilité pour choisir entre des solutions de reconnaissance vocale basées sur le cloud et sur l'appareil.