Un kit de herramientas exhaustivo para visión artificial que proporciona bloques de construcción agnósticos al modelo para la carga de datos, visualización y gestión de conjuntos de datos.
Código abierto. Nuevas posibilidades.
Descubre proyectos de código abierto de calidad, envía proyectos de forma anónima y reclama y edita tu propio proyecto.
Un poco de curiosidad. Un mundo de código abierto.
THE FIRST COLLECTIONUn plan de estudios de ingeniería de IA gratuito y de código abierto basado en principios fundamentales: 523 lecciones en 20 fases (~342 horas), con cobertura desde las matemáticas hasta la producción en Python, TypeScript, Rust y Julia. Cada lección genera un artefacto reutilizable; incluye un tutor de IA instalable y preparación para la certificación de Claude.
Una colección creciente de 61 tutoriales de visión por computadora que cubren modelos de vanguardia como YOLO11, SAM 3, RF-DETR y Qwen3-VL para detección de objetos, segmentación, OCR y más.
AirSim es el simulador de código abierto de Microsoft para drones y automóviles, creado como complemento de Unreal Engine con una versión experimental para Unity. Admite simulación con software y hardware en el bucle mediante PX4 y ArduPilot, y expone API multiplataforma para capturar imágenes y controlar vehículos en investigación de IA.
dlib es un toolkit integral de C++ para crear software complejo usando aprendizaje automático y análisis de datos, con soporte para C++ y Python.
Label Studio es una herramienta de etiquetado de datos de código abierto y múltiples tipos que admite audio, texto, imágenes, video y series temporales, con una interfaz sencilla y exportación a varios formatos de modelos.
Meshify es una aplicación de detección de malla facial en tiempo real que identifica y rastrea puntos de referencia faciales utilizando OpenCV, MediaPipe y CVZone.
X-AnyLabeling 是一款跨平台桌面应用,支持 AI 辅助标注图像、视频、文本和多模态数据,内置多种深度学习模型、丰富标注工具及多格式导入导出。
Un sistema local de asistencia por reconocimiento facial con una aplicación móvil React Native Expo y un backend FastAPI Python. Captura rostros vía Expo Camera, los procesa con OpenCV LBPH y registra la asistencia en SQLite.
Deep Lake es una base de datos multimodal serverless para IA que combina búsqueda vectorial con almacenamiento de embeddings, imágenes, video, audio y documentos. Transmite datos directamente desde almacenamiento en la nube a PyTorch/TensorFlow, soporta versionado y se integra con LangChain, LlamaIndex y Weights & Biases.
Ultralytics ofrece un conjunto de modelos YOLO de última generación para tareas de visión artificial, incluyendo detección de objetos, segmentación y clasificación.
OpenCV es una biblioteca de visión artificial de código abierto que ofrece una amplia gama de herramientas para el procesamiento de imágenes y el análisis visual.
Un plan de estudios gratuito de 12 semanas y 24 lecciones de Microsoft para aprender fundamentos de IA: redes neuronales, aprendizaje profundo, visión por computadora, PLN, transformadores y ética, con cuadernos prácticos, cuestionarios y laboratorios.
RF-DETR es una arquitectura de transformer en tiempo real de Roboflow para detección de objetos, segmentación de instancias y detección de puntos clave, basada en un backbone DINOv2 y diseñada para ajuste fino.
jetson-inference es una biblioteca de visión profunda en C++ y Python para NVIDIA Jetson. Usa TensorRT para inferencia en el dispositivo y PyTorch para entrenamiento, con ejemplos, modelos preentrenados y tutoriales de clasificación, detección, segmentación, pose, acción, profundidad y transmisión de cámara.
MediaPipe es el framework multiplataforma de Google y un conjunto de soluciones de aprendizaje automático en el dispositivo para medios en vivo y en streaming, que cubre tareas de visión, texto y audio en Android, iOS, web, escritorio y dispositivos periféricos.
Un proyecto de AI/ML que utiliza visión artificial para detectar animales como elefantes, ganado y monos en zonas agrícolas, con el objetivo de prevenir daños en los cultivos. El README es breve y remite a los usuarios al código fuente para los detalles de configuración.
YOLOv5 es un marco de visión por computadora rápido y preciso en PyTorch para detección de objetos, segmentación de instancias e clasificación de imágenes. Soporta entrenamiento en conjuntos de datos personalizados, inferencia desde diversas fuentes y exportación de modelos a formatos como ONNX, TensorRT y CoreML.
Demo de detección facial basada en el navegador creada con face-api.js y TensorFlow.js, empaquetada como una imagen de Docker servida por nginx, junto con notas de investigación que comparan detectores Viola-Jones, HOG+SVM y CNN.
FiftyOne es una herramienta de código abierto para crear conjuntos de datos de alta calidad y modelos de visión por computadora. Permite a los usuarios visualizar, etiquetar, evaluar y curar datos de inteligencia artificial visual.