Handy es una aplicación de escritorio gratuita, de código abierto y multiplataforma de voz a texto que funciona completamente sin conexión. Presiona un atajo, habla y obtén el texto transcrito pegado en cualquier campo de texto usando modelos Whisper o Parakeet.
Código abierto. Nuevas posibilidades.
Descubre proyectos de código abierto de calidad, envía proyectos de forma anónima y reclama y edita tu propio proyecto.
Un poco de curiosidad. Un mundo de código abierto.
THE FIRST COLLECTIONWhisperLiveKit (WLK) es un sistema de voz a texto de código abierto y autoalojado diseñado para transcripción en tiempo real de ultra baja latencia. Soporta múltiples modelos y provides APIs compatibles con OpenAI y Deepgram.
Lamitype es una aplicación gratuita, de código abierto y centrada en la privacidad para convertir voz a texto en macOS. Ejecuta localmente el modelo Qwen3-ASR en Apple Silicon, prioriza el chino tradicional, ofrece subtítulos en tiempo real, traducción y corrección de texto, y dictado en la nube opcional.
Un plugin de LLM multimodal local para Unreal Engine 5 que proporciona inferencia offline para texto, speech-to-text y text-to-speech.
Un pipeline modular de agente de voz de baja latencia (VAD -> STT -> LLM -> TTS) que implementa el conjunto de eventos OpenAI Realtime sobre WebSocket y WebRTC.
Douvo es una aplicación ligera de entrada de voz para macOS en Apple Silicon que usa Doubao ASR con posprocesamiento de IA opcional para limpiar texto, traducir y editar texto seleccionado.
Lexos es un motor de procesamiento de documentos con IA basado en eventos, que combina una puerta de enlace Go, trabajadores Python, colas Redis y modelos autoalojados para RAG, resumen y transcripción de voz sin conexión.
SpeechRecognition es una biblioteca de Python para reconocimiento de voz compatible con múltiples motores y API, tanto en línea como fuera de línea, incluidos CMU Sphinx, Google, Azure, IBM, Vosk, Whisper y OpenAI.
Una implementación de C/C++ de alto rendimiento para la inferencia del modelo de reconocimiento automático de voz (ASR) Whisper de OpenAI, diseñada para un despliegue ligero y multiplataforma.
Bolo es una aplicación gratuita de dictado push-to-talk para macOS, escrita en Rust, que transcribe el habla y pega el texto resultante en cualquier campo de texto activo. Utiliza la API de speech-to-text de Telnyx y admite la limpieza opcional de LLM, el historial de transcripciones local y la personalización de vocabulario.
SkyClass Distill es una herramienta de flujo de trabajo que transforma videos educativos en habilidades de enseñanza (Teaching Skills) estructuradas, admitiendo la captura de video, transcripción, extracción de evidencia y destilación mediante LLM.
TypeNo es una app open-source para macOS que transcribe voz localmente y pega el texto al instante, sin cuentas ni configuraciones, priorizando la privacidad.
Velo AI Studio es una herramienta de creación de videos de código abierto basada en el navegador diseñada para ensamblar videos narrados a partir de guiones, audio y recursos visuales generados por IA.
Una reimplementación rápida del modelo Whisper de OpenAI utilizando CTranslate2, que ofrece una mayor velocidad de transcripción y un menor uso de memoria.
SenseVoiceSmall es un modelo fundacional de voz de código abierto para ASR, identificación de idioma, reconocimiento de emociones y detección de eventos de audio, que cubre mandarín, cantonés, inglés, japonés y coreano con inferencia no autorregresiva rápida.
LazyEdit es un flujo de trabajo de video asistido por IA y local-first para la creación, procesamiento y publicación opcional de contenido de extremo a extremo.
Herramienta open-source para traducción de videos, transcripción de audio, doblaje con IA y traducción de subtítulos, con soporte local y APIs en línea.