OPEN SOURCE, OPEN TO EVERYONE

Código abierto. Nuevas posibilidades.

Descubre proyectos de código abierto de calidad, envía proyectos de forma anónima y reclama y edita tu propio proyecto.

Selección editorial · Descubre buen código abierto4092descubiertos

Un poco de curiosidad. Un mundo de código abierto.

THE FIRST COLLECTION
Topic: speech-to-text清除
handycjpais
NUEVO

Handy es una aplicación de escritorio gratuita, de código abierto y multiplataforma de voz a texto que funciona completamente sin conexión. Presiona un atajo, habla y obtén el texto transcrito pegado en cualquier campo de texto usando modelos Whisper o Parakeet.

IAProductividadMultimodal AI
whisperlivekitQuentinFuxa
NUEVO

WhisperLiveKit (WLK) es un sistema de voz a texto de código abierto y autoalojado diseñado para transcripción en tiempo real de ultra baja latencia. Soporta múltiples modelos y provides APIs compatibles con OpenAI y Deepgram.

IADesarrolloModel runtime
lamitypefelixfu824
NUEVO

Lamitype es una aplicación gratuita, de código abierto y centrada en la privacidad para convertir voz a texto en macOS. Ejecuta localmente el modelo Qwen3-ASR en Apple Silicon, prioriza el chino tradicional, ofrece subtítulos en tiempo real, traducción y corrección de texto, y dictado en la nube opcional.

ProductividadIAUtilities
LLM_Pluginisundahl
NUEVO

Un plugin de LLM multimodal local para Unreal Engine 5 que proporciona inferencia offline para texto, speech-to-text y text-to-speech.

JuegosIAGame development tools
speech-to-speechhuggingface
NUEVO

Un pipeline modular de agente de voz de baja latencia (VAD -> STT -> LLM -> TTS) que implementa el conjunto de eventos OpenAI Realtime sobre WebSocket y WebRTC.

IADesarrolloAI assistants
douvorhinoc
NUEVO

Douvo es una aplicación ligera de entrada de voz para macOS en Apple Silicon que usa Doubao ASR con posprocesamiento de IA opcional para limpiar texto, traducir y editar texto seleccionado.

ProductividadIAUtilities
lexoscauafsantosdev
NUEVO

Lexos es un motor de procesamiento de documentos con IA basado en eventos, que combina una puerta de enlace Go, trabajadores Python, colas Redis y modelos autoalojados para RAG, resumen y transcripción de voz sin conexión.

IAAutoalojamientoRAG & knowledge

SpeechRecognition es una biblioteca de Python para reconocimiento de voz compatible con múltiples motores y API, tanto en línea como fuera de línea, incluidos CMU Sphinx, Google, Azure, IBM, Vosk, Whisper y OpenAI.

IADesarrolloMultimodal AI
whisper.cppggml-org
NUEVO

Una implementación de C/C++ de alto rendimiento para la inferencia del modelo de reconocimiento automático de voz (ASR) Whisper de OpenAI, diseñada para un despliegue ligero y multiplataforma.

IAModel runtime
boloa692570
NUEVO

Bolo es una aplicación gratuita de dictado push-to-talk para macOS, escrita en Rust, que transcribe el habla y pega el texto resultante en cualquier campo de texto activo. Utiliza la API de speech-to-text de Telnyx y admite la limpieza opcional de LLM, el historial de transcripciones local y la personalización de vocabulario.

ProductividadIAUtilities
skyclass-distillRicardo-Ssy
NUEVO

SkyClass Distill es una herramienta de flujo de trabajo que transforma videos educativos en habilidades de enseñanza (Teaching Skills) estructuradas, admitiendo la captura de video, transcripción, extracción de evidencia y destilación mediante LLM.

IAProductividadAI agents
typenomarswaveai
NUEVO

TypeNo es una app open-source para macOS que transcribe voz localmente y pega el texto al instante, sin cuentas ni configuraciones, priorizando la privacidad.

MúsicaAudio editing
NUEVO

Velo AI Studio es una herramienta de creación de videos de código abierto basada en el navegador diseñada para ensamblar videos narrados a partir de guiones, audio y recursos visuales generados por IA.

MúsicaDAW & production
NUEVO

Una reimplementación rápida del modelo Whisper de OpenAI utilizando CTranslate2, que ofrece una mayor velocidad de transcripción y un menor uso de memoria.

IAModel runtime
sensevoiceQwenAudio
NUEVO

SenseVoiceSmall es un modelo fundacional de voz de código abierto para ASR, identificación de idioma, reconocimiento de emociones y detección de eventos de audio, que cubre mandarín, cantonés, inglés, japonés y coreano con inferencia no autorregresiva rápida.

IADesarrolloModel runtime
LazyEditlachlanchen
SELECCIÓN

LazyEdit es un flujo de trabajo de video asistido por IA y local-first para la creación, procesamiento y publicación opcional de contenido de extremo a extremo.

Cine, vídeo y mediosIAVideo editing
pyvideotransjianchang512
NUEVO

Herramienta open-source para traducción de videos, transcripción de audio, doblaje con IA y traducción de subtítulos, con soporte local y APIs en línea.

IACine, vídeo y mediosMultimodal AI