Sobre el proyecto
SpeechRecognition es una biblioteca de Python ampliamente utilizada que proporciona una interfaz unificada para realizar reconocimiento de voz en una amplia gama de motores y API, tanto en línea como fuera de línea. Abstrae la complejidad de integrarse con diferentes servicios de voz a texto, lo que permite a los desarrolladores cambiar entre proveedores con cambios mínimos en el código.
Los motores y API compatibles incluyen CMU Sphinx (fuera de línea), Google Speech Recognition, Google Cloud Speech API, Wit.ai, Microsoft Azure Speech, Houndify API, IBM Speech to Text, Snowboy Hotword Detection (fuera de línea), TensorFlow, Vosk API (fuera de línea), OpenAI Whisper (fuera de línea), OpenAI Transcription API (incluidos endpoints autoalojados compatibles con OpenAI como vLLM y Ollama), Groq Whisper API y Cohere Transcribe API.
La biblioteca requiere Python 3.10 o posterior. Las dependencias opcionales se instalan mediante extras de pip: PyAudio para entrada de micrófono, PocketSphinx para el reconocedor Sphinx, google-cloud-speech para Google Cloud Speech-to-Text, Vosk para reconocimiento fuera de línea, Whisper o Faster Whisper para transcripción local, openai para OpenAI Transcription API, groq para Groq Whisper API y cohere para Cohere Transcribe API. Se incluye un codificador FLAC para sistemas Windows, Linux y OS X basados en x86, pero debe instalarse por separado en otras plataformas.
Las características clave incluyen captura de voz basada en micrófono, transcripción de archivos de audio, escucha en segundo plano, calibración del umbral de energía para ruido ambiental y resultados de reconocimiento extendidos. La biblioteca proporciona una API simple con métodos como recognize_sphinx, recognize_google, recognize_google_cloud, recognize_wit, recognize_api, recognize_houndify, recognize_ibm, recognize_snowboy, recognize_tensorflow, recognize_vosk, recognize_whisper, recognize_faster_whisper, recognize_openai, recognize_groq y recognize_cohere_api.
El repositorio incluye un directorio completo de ejemplos con patrones de uso para reconocimiento por micrófono, transcripción de archivos de audio, guardado de datos de audio, resultados extendidos, calibración del umbral de energía, escucha en segundo plano y características especiales del reconocedor. La documentación de solución de problemas cubre problemas comunes como activaciones falsas, compatibilidad de idioma/dialecto, problemas de micrófono en Raspberry Pi, compatibilidad con PyInstaller y errores de audio específicos de la plataforma.
La biblioteca está publicada en PyPI y se mantiene activamente con contribuciones de múltiples autores. Es adecuada para desarrolladores que crean aplicaciones habilitadas para voz, herramientas de transcripción e interfaces controladas por voz que necesitan flexibilidad para elegir entre soluciones de reconocimiento de voz basadas en la nube y en el dispositivo.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.