这个项目能做什么

SpeechRecognition 是一个广泛使用的 Python 库,为各种在线和离线引擎与 API 提供统一的语音识别接口。它抽象了与不同语音转文本服务集成的复杂性,使开发者能够以最少的代码更改在不同提供商之间切换。 支持的引擎和 API 包括 CMU Sphinx(离线)、Google Speech Recognition、Google Cloud Speech API、Wit.ai、Microsoft Azure Speech、Houndify API、IBM Speech to Text、Snowboy Hotword Detection(离线)、TensorFlow、Vosk API(离线)、OpenAI Whisper(离线)、OpenAI Transcription API(包括 OpenAI 兼容的自托管端点,如 vLLM 和 Ollama)、Groq Whisper API 和 Cohere Transcribe API。 该库要求 Python 3.10 或更高版本。可选依赖通过 pip extras 安装:PyAudio 用于麦克风输入,PocketSphinx 用于 Sphinx 识别器,google-cloud-speech 用于 Google Cloud Speech-to-Text,Vosk 用于离线识别,Whisper 或 Faster Whisper 用于本地转录,openai 用于 OpenAI Transcription API,groq 用于 Groq Whisper API,cohere 用于 Cohere Transcribe API。FLAC 编码器已为基于 x86 的 Windows、Linux 和 OS X 系统捆绑提供,但在其他平台上必须单独安装。 主要功能包括基于麦克风的语音采集、音频文件转录、后台监听、环境噪声能量阈值校准以及扩展识别结果。该库提供简单的 API,包含 recognize_sphinx、recognize_google、recognize_google_cloud、recognize_wit、recognize_api、recognize_houndify、recognize_ibm、recognize_snowboy、recognize_tensorflow、recognize_vosk、recognize_whisper、recognize_faster_whisper、recognize_openai、recognize_groq 和 recognize_cohere_api 等方法。 该仓库包含一个全面的 examples 目录,提供麦克风识别、音频文件转录、保存音频数据、扩展结果、能量阈值校准、后台监听以及特殊识别器功能的使用模式。故障排除文档涵盖常见问题,如误触发、语言/方言支持、Raspberry Pi 麦克风问题、PyInstaller 兼容性以及平台特定的音频错误。 该库发布在 PyPI 上,由多位作者贡献并积极维护。它适合构建语音启用应用、转录工具和语音驱动界面的开发者,这些开发者需要在基于云端和端侧语音识别解决方案之间灵活选择。