Об этом проекте

SpeechRecognition — это широко используемая библиотека Python, предоставляющая единый интерфейс для распознавания речи в широком диапазоне движков и API, как онлайн, так и офлайн. Она абстрагирует сложность интеграции с различными сервисами преобразования речи в текст, позволяя разработчикам переключаться между провайдерами с минимальными изменениями кода. Поддерживаемые движки и API включают CMU Sphinx (офлайн), Google Speech Recognition, Google Cloud Speech API, Wit.ai, Microsoft Azure Speech, Houndify API, IBM Speech to Text, Snowboy Hotword Detection (офлайн), TensorFlow, Vosk API (офлайн), OpenAI Whisper (офлайн), OpenAI Transcription API (включая совместимые с OpenAI самостоятельно размещенные конечные точки, такие как vLLM и Ollama), Groq Whisper API и Cohere Transcribe API. Библиотека требует Python 3.10 или новее. Дополнительные зависимости устанавливаются через pip extras: PyAudio для ввода с микрофона, PocketSphinx для распознавателя Sphinx, google-cloud-speech для Google Cloud Speech-to-Text, Vosk для офлайн-распознавания, Whisper или Faster Whisper для локальной транскрипции, openai для OpenAI Transcription API, groq для Groq Whisper API и cohere для Cohere Transcribe API. Кодировщик FLAC встроен для систем Windows, Linux и OS X на базе x86, но на других платформах его необходимо устанавливать отдельно. Ключевые функции включают захват речи с микрофона, транскрипцию аудиофайлов, фоновое прослушивание, калибровку порога энергии для фонового шума и расширенные результаты распознавания. Библиотека предоставляет простой API с такими методами, как recognize_sphinx, recognize_google, recognize_google_cloud, recognize_wit, recognize_api, recognize_houndify, recognize_ibm, recognize_snowboy, recognize_tensorflow, recognize_vosk, recognize_whisper, recognize_faster_whisper, recognize_openai, recognize_groq и recognize_cohere_api. Репозиторий включает обширный каталог примеров с шаблонами использования для распознавания с микрофона, транскрипции аудиофайлов, сохранения аудиоданных, расширенных результатов, калибровки порога энергии, фонового прослушивания и специальных функций распознавателей. Документация по устранению неполадок охватывает распространенные проблемы, такие как ложные срабатывания, поддержка языков и диалектов, проблемы с микрофоном на Raspberry Pi, совместимость с PyInstaller и специфические для платформ ошибки аудио. Библиотека опубликована на PyPI и активно поддерживается при участии нескольких авторов. Она подходит для разработчиков, создающих приложения с голосовым управлением, инструменты транскрипции и интерфейсы, управляемые речью, которым нужна гибкость в выборе между облачными и локальными решениями для распознавания речи.