Sobre el proyecto
Inkwell es una aplicación de dictado de escritorio gratuita, de código abierto y local-first que convierte tu voz en texto directamente en tu máquina. Está diseñada para la privacidad: el audio se captura, se remuestrea y se transcribe localmente mediante reconocimiento de voz basado en CPU, y nunca se sube. No hay cuentas, ni telemetría, ni analíticas. Las transcripciones se almacenan en una base de datos SQLite local.
Las características principales incluyen:
- **Dictado en cualquier lugar**: Usa un atajo global (push-to-talk o alternar) para grabar, luego el texto transcrito se pega en la aplicación enfocada.
- **Reconocimiento de voz local**: Cinco modelos mediante sherpa-onnx, cada uno optimizado para diferentes idiomas, precisión y uso de recursos. Los modelos se descargan en el primer uso y se pueden cambiar en la aplicación.
- **Formato de estilo**: Elige entre estilos Formal, Casual o Relaxed para controlar mayúsculas y puntuación sin afectar al modelo.
- **Diccionario personalizado**: Corrige palabras que el modelo falla, con coincidencia sin distinción de mayúsculas y límites de palabra.
- **Fragmentos**: Las frases desencadenantes se expanden a texto completo, con variables como {date}, {time} y {clipboard}.
- **Comandos de voz**: Usa un prefijo de activación más una acción, por ejemplo, "inkwell, scratch that" o "inkwell, formal mode".
- **Modos**: Agrupa estilo, limpieza de voz y pulido con IA, activados automáticamente según la aplicación en la que escribes (por ejemplo, formal en correo electrónico, minúsculas en terminal). Funciona en macOS y Windows.
- **Transcripción de archivos**: Arrastra archivos de audio o video (MP3, WAV, FLAC, OGG, M4A, MP4, MKV, etc.) para transcribir.
- **Historial y exportación**: Historial de transcripciones buscable y editable con exportación a TXT, SRT, JSON y CSV.
- **Estadísticas**: Palabras dictadas, tiempo hablando, racha, actividad diaria y uso de modelos, todo calculado desde el historial local.
- **Bandeja y superposición**: Vive en la bandeja del sistema con una pequeña superposición siempre visible que muestra el estado de grabación.
- **Vista previa en vivo (opcional)**: Ve las palabras aparecer en la superposición mientras hablas, usando un modelo secundario más rápido.
- **Edición por voz**: Selecciona texto, mantén presionado un segundo atajo, di qué cambiar y la reescritura reemplaza la selección. Requiere una clave API.
- **Limpieza de voz**: Elimina "um", "uh" y tartamudeos inmediatos antes de pegar.
- **Pulido con IA (opcional)**: Trae tu propia clave API para limpiar gramática y falsos comienzos. Compatible con OpenAI, Groq, Anthropic, OpenRouter o cualquier endpoint compatible con OpenAI.
La privacidad es un enfoque central. El audio nunca sale de la máquina. Las únicas llamadas de red son para descargas de modelos (desde Hugging Face y GitHub), verificaciones de actualizaciones (a un worker de Cloudflare) y, cuando usas pulido con IA o edición por voz, enviar texto (nunca audio) a tu proveedor elegido. Las claves API se almacenan en el llavero del sistema operativo.
Inkwell tiene licencia MIT y es gratis para siempre, sin nivel de pago ni claves de licencia. Está construido con Rust, Tauri v2, React 19, TypeScript, Tailwind v4, y usa sherpa-onnx para inferencia, Silero VAD para detección de actividad de voz, cpal para captura de audio y SQLite para el historial.
Instalación: Hay binarios precompilados disponibles para macOS (firmados y notarizados), Windows (instalador NSIS o MSI, aún no firmado) y Linux (AppImage y .deb, best effort). Compilar desde el código fuente requiere Rust y Node.js.
Inkwell es ideal para usuarios que quieren un dictado confiable y privado sin dependencias de la nube, y que valoran el control sobre sus datos y la capacidad de personalizar el formato y los comandos.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.