프로젝트 소개

SpeechRecognition은 온라인 및 오프라인에서 광범위한 엔진과 API에 걸쳐 음성 인식을 수행하기 위한 통합 인터페이스를 제공하는 널리 사용되는 Python 라이브러리입니다. 다양한 음성-텍스트 서비스와 통합할 때의 복잡성을 추상화하여 개발자가 최소한의 코드 변경으로 공급자를 전환할 수 있게 해줍니다. 지원되는 엔진과 API로는 CMU Sphinx(오프라인), Google Speech Recognition, Google Cloud Speech API, Wit.ai, Microsoft Azure Speech, Houndify API, IBM Speech to Text, Snowboy Hotword Detection(오프라인), TensorFlow, Vosk API(오프라인), OpenAI Whisper(오프라인), OpenAI Transcription API(vLLM 및 Ollama와 같은 OpenAI 호환 자체 호스팅 엔드포인트 포함), Groq Whisper API, Cohere Transcribe API가 있습니다. 이 라이브러리는 Python 3.10 이상이 필요합니다. 선택적 종속성은 pip extras로 설치됩니다: 마이크 입력용 PyAudio, Sphinx 인식기용 PocketSphinx, Google Cloud Speech-to-Text용 google-cloud-speech, 오프라인 인식용 Vosk, 로컬 전사를 위한 Whisper 또는 Faster Whisper, OpenAI Transcription API용 openai, Groq Whisper API용 groq, Cohere Transcribe API용 cohere. FLAC 인코더는 x86 기반 Windows, Linux 및 OS X 시스템에 번들로 제공되지만 다른 플랫폼에서는 별도로 설치해야 합니다. 주요 기능으로는 마이크 기반 음성 캡처, 오디오 파일 전사, 백그라운드 청취, 주변 소음에 대한 에너지 임계값 보정, 확장된 인식 결과가 포함됩니다. 이 라이브러리는 recognize_sphinx, recognize_google, recognize_google_cloud, recognize_wit, recognize_api, recognize_houndify, recognize_ibm, recognize_snowboy, recognize_tensorflow, recognize_vosk, recognize_whisper, recognize_faster_whisper, recognize_openai, recognize_groq, recognize_cohere_api와 같은 메서드를 제공하는 간단한 API를 제공합니다. 저장소에는 마이크 인식, 오디오 파일 전사, 오디오 데이터 저장, 확장 결과, 에너지 임계값 보정, 백그라운드 청취 및 특수 인식기 기능에 대한 사용 패턴이 포함된 포괄적인 예제 디렉토리가 있습니다. 문제 해결 문서에서는 오탐(false trigger), 언어/방언 지원, Raspberry Pi 마이크 문제, PyInstaller 호환성, 플랫폼별 오디오 오류와 같은 일반적인 문제를 다룹니다. 이 라이브러리는 PyPI에 게시되어 있으며 여러 저자의 기여로 적극적으로 유지관리되고 있습니다. 클라우드 기반 및 온디바이스 음성 인식 솔루션 중에서 유연하게 선택해야 하는 음성 지원 애플리케이션, 전사 도구 및 음성 기반 인터페이스를 구축하는 개발자에게 적합합니다.