MoneyPrinterTurbo es una herramienta integral de generación de videos cortos con IA: basta con introducir un tema o palabra clave para que complete automáticamente guion, voz en off, material, subtítulos, música y edición, y genere video HD en 9:16, 16:9 y 1:1, con cuatro modos de uso: WebUI, API, CLI y AI Agent.
Código abierto. Nuevas posibilidades.
Descubre proyectos de código abierto de calidad, envía proyectos de forma anónima y reclama y edita tu propio proyecto.
Un poco de curiosidad. Un mundo de código abierto.
THE FIRST COLLECTIONPageLedger es una biblioteca CLI de Python para OCR y extracción de documentos con trazabilidad página por página. Registra procedencia, señales de calidad y presupuestos por cada página, con ejecución reanudable, colas de revisión y verificación humana.
Rembg es una herramienta versátil para eliminar fondos de imágenes, disponible como CLI, librería de Python, servidor HTTP o contenedor de Docker.
SpeechRecognition es una biblioteca de Python para reconocimiento de voz compatible con múltiples motores y API, tanto en línea como fuera de línea, incluidos CMU Sphinx, Google, Azure, IBM, Vosk, Whisper y OpenAI.
EasyOCR es una biblioteca de código abierto de reconocimiento óptico de caracteres lista para usar, compatible con más de 80 idiomas y escrituras principales. Ofrece una API simple de Python y CLI, con modelos de detección y reconocimiento basados en PyTorch, y opciones de entrenamiento personalizado.
Meshify es una aplicación de detección de malla facial en tiempo real que identifica y rastrea puntos de referencia faciales utilizando OpenCV, MediaPipe y CVZone.
Dolphin es el modelo de código abierto de ByteDance para el análisis de imágenes de documentos (ACL 2025) que convierte PDFs y páginas fotografiadas en Markdown/JSON estructurado, abarcando diseño, orden de lectura, texto, tablas, fórmulas y código.
Bolo es una aplicación gratuita de dictado push-to-talk para macOS, escrita en Rust, que transcribe el habla y pega el texto resultante en cualquier campo de texto activo. Utiliza la API de speech-to-text de Telnyx y admite la limpieza opcional de LLM, el historial de transcripciones local y la personalización de vocabulario.
VoxCPM2 es un sistema de texto a voz sin tokenizador con un modelo autoregresivo de difusión de 2B que soporta 30 idiomas, diseño de voz a partir de descripciones de texto, clonación de voz controlable y salida de audio de 48 kHz.
Un sistema local de asistencia por reconocimiento facial con una aplicación móvil React Native Expo y un backend FastAPI Python. Captura rostros vía Expo Camera, los procesa con OpenCV LBPH y registra la asistencia en SQLite.
Una biblioteca de Python y herramienta de línea de comandos para el reconocimiento facial, la detección de rasgos faciales y la comparación de rostros, construida sobre los modelos de aprendizaje profundo de dlib.
ChatTTS es un modelo de síntesis de voz de código abierto diseñado para escenarios de diálogo, soportando inglés y chino con salida de múltiples hablantes y control detallado sobre risas, pausas y prosodia.
LazyEdit es un flujo de trabajo de video asistido por IA y local-first para la creación, procesamiento y publicación opcional de contenido de extremo a extremo.
TextBlob es una biblioteca de Python para procesamiento de lenguaje natural, con API simple para análisis de sentimientos, etiquetado gramatical, extracción de frases nominales, clasificación, tokenización y más, construida sobre NLTK y pattern.