Sobre o projeto
SpeechRecognition é uma biblioteca Python amplamente utilizada que fornece uma interface unificada para realizar reconhecimento de fala em uma ampla variedade de motores e APIs, tanto online quanto offline. Ela abstrai a complexidade da integração com diferentes serviços de conversão de fala em texto, permitindo que desenvolvedores alternem entre provedores com mudanças mínimas no código.
Os motores e APIs suportados incluem CMU Sphinx (offline), Google Speech Recognition, Google Cloud Speech API, Wit.ai, Microsoft Azure Speech, Houndify API, IBM Speech to Text, Snowboy Hotword Detection (offline), TensorFlow, Vosk API (offline), OpenAI Whisper (offline), OpenAI Transcription API (incluindo endpoints auto-hospedados compatíveis com OpenAI, como vLLM e Ollama), Groq Whisper API e Cohere Transcribe API.
A biblioteca requer Python 3.10 ou superior. Dependências opcionais são instaladas via extras do pip: PyAudio para entrada de microfone, PocketSphinx para o reconhecedor Sphinx, google-cloud-speech para Google Cloud Speech-to-Text, Vosk para reconhecimento offline, Whisper ou Faster Whisper para transcrição local, openai para a OpenAI Transcription API, groq para a Groq Whisper API e cohere para a Cohere Transcribe API. Um codificador FLAC é incluído para sistemas Windows, Linux e OS X baseados em x86, mas deve ser instalado separadamente em outras plataformas.
Os principais recursos incluem captura de fala por microfone, transcrição de arquivos de áudio, escuta em segundo plano, calibração de limite de energia para ruído ambiente e resultados de reconhecimento estendidos. A biblioteca fornece uma API simples com métodos como recognize_sphinx, recognize_google, recognize_google_cloud, recognize_wit, recognize_api, recognize_houndify, recognize_ibm, recognize_snowboy, recognize_tensorflow, recognize_vosk, recognize_whisper, recognize_faster_whisper, recognize_openai, recognize_groq e recognize_cohere_api.
O repositório inclui um diretório abrangente de exemplos com padrões de uso para reconhecimento por microfone, transcrição de arquivos de áudio, salvamento de dados de áudio, resultados estendidos, calibração de limite de energia, escuta em segundo plano e recursos especiais do reconhecedor. A documentação de solução de problemas cobre questões comuns, como acionamentos falsos, suporte a idiomas/dialetos, problemas de microfone no Raspberry Pi, compatibilidade com PyInstaller e erros de áudio específicos de plataforma.
A biblioteca é publicada no PyPI e é mantida ativamente com contribuições de vários autores. É adequada para desenvolvedores que criam aplicações com voz, ferramentas de transcrição e interfaces controladas por fala que precisam de flexibilidade para escolher entre soluções de reconhecimento de fala baseadas em nuvem e no dispositivo.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.