SpeechRecognition es una biblioteca de Python para reconocimiento de voz compatible con múltiples motores y API, tanto en línea como fuera de línea, incluidos CMU Sphinx, Google, Azure, IBM, Vosk, Whisper y OpenAI.
Código abierto. Nuevas posibilidades.
Descubre proyectos de código abierto de calidad, envía proyectos de forma anónima y reclama y edita tu propio proyecto.
Un poco de curiosidad. Un mundo de código abierto.
THE FIRST COLLECTIONUn plugin VST3/AU que integra la generación de sonidos de ElevenLabs directamente en su DAW para crear y fragmentar efectos de sonido.
Un puente MCP genérico que permite a los agentes de IA controlar plugins VST3/AU con una capa semántica para el mapeo de parámetros y un sistema de bucle cerrado para la medición y el ajuste de audio.
VoxCPM2 es un sistema de texto a voz sin tokenizador con un modelo autoregresivo de difusión de 2B que soporta 30 idiomas, diseño de voz a partir de descripciones de texto, clonación de voz controlable y salida de audio de 48 kHz.
Sourdaw es una estación de trabajo de audio digital (DAW) de código abierto que cuenta con un motor DSP impulsado por Rust y un sistema de agentes de IA integrado para tareas de producción.
Hugging Face Transformers es un marco de definición de modelos para aprendizaje automático en tareas de texto, visión, audio y multimodales. Proporciona una API unificada para inferencia y entrenamiento con más de 1 millón de checkpoints preentrenados.
TastyTunes es un controlador de escritorio gratuito para streamers de red Cambridge Audio StreamMagic: navegación de biblioteca local, letras sincronizadas, radio por internet, presets y edición de cola, además de un servidor MCP opcional para agentes de IA locales.