Sobre el proyecto
EnviousWispr es una aplicación gratuita y de código abierto de dictado con IA y conversión de voz a texto para macOS, creada para Apple Silicon y diseñada para ejecutarse completamente en el dispositivo. El audio se procesa localmente y nunca se sube; no se requiere cuenta ni suscripción, y la app funciona sin conexión.
Flujo principal: pulsa un atajo de teclado global desde cualquier app, habla, y la app transcribe localmente, opcionalmente pule el texto con un LLM, luego lo copia al portapapeles y puede autopegarlo en la app activa. El README describe una transcripción en menos de un segundo, con el flujo completo de atajo a pegado típicamente alrededor de un segundo y medio cuando el pulido de IA está activado. Silero VAD detecta cuándo dejas de hablar y finaliza la grabación automáticamente. Los modos de atajo incluyen pulsar para hablar, alternar y manos libres (doble pulsación para bloquear en dictado de formato largo).
Se ofrecen dos motores ASR. Parakeet TDT v3 (NVIDIA NeMo, mediante FluidAudio) es el predeterminado, se ejecuta en el Apple Neural Engine, admite 25 idiomas europeos y necesita aproximadamente 460 MB de disco. WhisperKit (OpenAI Whisper Large v3 Turbo, mediante argmax) se ejecuta en la GPU, admite más de 99 idiomas con detección automática de idioma y necesita aproximadamente 1,6 GB. Ambos se ejecutan mediante CoreML; el primer inicio descarga y compila el modelo.
El pulido de IA es opcional y por defecto permanece en el dispositivo. Las opciones incluyen EG-1, el modelo de limpieza propio del proyecto ajustado finamente (unos 2,9 GB, macOS 14+); S1-mini de Superwhisper (unos 484 MB, orientado al inglés, con ajustes de estilo Tone, Structure y Context); Apple Intelligence (macOS 26+, sin descarga adicional); y Ollama (local o alojado). El pulido en la nube mediante OpenAI, Gemini o Claude es con clave propia y envía solo texto, nunca audio. El README indica que EG-1 se distribuye bajo su propia licencia de modelo en lugar de la GPLv3 de la app, y es un derivado ajustado finamente de Qwen3-4B-Instruct-2507.
Los aspectos destacados del README incluyen: Live Preview de palabras en la píldora de grabación mientras hablas; Escape Recovery, que conserva el texto del dictado cancelado durante 24 horas (solo texto, nunca audio); Snippets que pegan texto guardado palabra por palabra con rellenos de fecha, hora o portapapeles; Transcribe a File para audio/vídeo existente (m4a, mp3, wav, aiff, caf, mp4, mov, flac) con turnos de hablante cuando las voces se pueden separar; vocabulario personalizado y paquetes de vocabulario con importación de Contactos; Quick Add para guardar una ortografía corregida desde cualquier lugar de macOS; dictado de emojis por nombre; formato determinista de números, fechas y dinero en inglés; historial con filtros All/Dictations/Transcripts; presencia en la barra de menús; y actualizaciones automáticas con Sparkle.
El README también documenta el trabajo de fiabilidad: la ruta crítica (grabar, transcribir, pegar) se mantiene separada de las mejoras opcionales para que los fallos en el pulido o el guardado del historial no bloqueen la entrega; una ruta de pegado de varios pasos recurre automáticamente a alternativas para apps que resisten el pegado estándar; la incorporación requiere permiso de Accesibilidad y vuelve a comprobarlo si se revoca; y el motor de voz se ejecuta dentro de la app en lugar de un ayudante separado para evitar congelaciones en reposo. Las versiones se describen como firmadas, notarizadas y verificadas por Gatekeeper.
Los requisitos son macOS 14 (Sonoma) o posterior y Apple Silicon (M1 o más reciente). La instalación es mediante Homebrew cask (saurabhav88/tap/enviouswispr) o descarga de DMG; se solicitan permisos para Micrófono, Accesibilidad y (en el primer recurso de pegado) Automatización. La compilación desde el código fuente usa Swift Package Manager para la compilación, mientras que el .app ejecutable se ensambla mediante Tuist y el motor de compilación de Xcode; los DMG de versión se producen con un script que requiere Xcode 26+ completo, mise y Tuist.
Las notas de arquitectura del README describen una máquina de estados de canalización (idle, recording, transcribing, polishing, complete), concurrencia estricta de Swift 6 con aislamiento de actores, backends Parakeet y WhisperKit deliberadamente separados, y un patrón "Heart & Limbs" donde la ruta crítica nunca falla y las funciones opcionales se degradan con elegancia.
Privacidad: el audio se procesa localmente y no se sube, aunque la recuperación local puede retener audio temporalmente. La analítica anónima de producto (PostHog) y los informes de fallos (Sentry) están activados por defecto y cada uno se puede desactivar en los ajustes; los informes de fallos excluyen el texto dictado y el audio. El proyecto tiene licencia GPLv3 para el código de la aplicación, con los pesos del modelo EG-1 bajo una licencia de modelo comunitaria separada que restringe la redistribución y el uso para entrenar modelos competidores. El nombre y el logotipo son marcas registradas.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.