Um toolkit abrangente para visão computacional que fornece blocos de construção agnósticos a modelos para carregamento de dados, visualização e gerenciamento de datasets.
Código aberto. Novas possibilidades.
Descubra projetos open source de qualidade, envie projetos anonimamente e reivindique e edite seu próprio projeto.
Um pouco de curiosidade. Um mundo de código aberto.
THE FIRST COLLECTIONCurrículo de engenharia de IA gratuito e de código aberto focado em primeiros princípios: 523 lições em 20 fases (~342 horas), com cobertura da matemática à produção em Python, TypeScript, Rust e Julia. Cada lição entrega um prompt, skill, agente ou servidor MCP reutilizável; inclui um tutor de IA instalável e preparação para certificação Claude.
Repositório com 61 tutoriais de visão computacional em notebooks Jupyter, cobrindo modelos como YOLO11, SAM 3 e Qwen3-VL para detecção, segmentação e OCR.
AirSim é o simulador de código aberto da Microsoft para drones e carros, construído como um plugin do Unreal Engine com um lançamento experimental para Unity. Ele suporta simulação software-in-the-loop e hardware-in-the-loop com PX4 e ArduPilot, e expõe APIs de várias linguagens para coletar imagens e controlar veículos para pesquisa em IA.
dlib é um toolkit abrangente em C++ projetado para criar software complexo, oferecendo algoritmos de aprendizado de máquina e análise de dados com suporte a C++ e Python.
Gesture Ninja é um aplicativo baseado em visão computacional que permite aos usuários jogar Fruit Ninja usando rastreamento de dedos em tempo real via webcam.
O Label Studio é uma ferramenta de anotação de dados open-source e multi-tipo, que suporta áudio, texto, imagens, vídeo e séries temporais, com uma interface simples e exportação para vários formatos de modelo.
Meshify é um aplicativo de detecção de malha facial em tempo real que identifica e rastreia marcos faciais usando OpenCV, MediaPipe e CVZone.
X-AnyLabeling é uma aplicação desktop multiplataforma e leve para anotação de dados assistida por IA, cobrindo texto, imagem, vídeo e dados multimodais. Oferece ampla variedade de ferramentas de rotulagem, integração com muitos modelos de deep learning, inferência local e remota, além de importação/exportação em diversos formatos.
Um sistema local de presença por reconhecimento facial com app React Native Expo e backend FastAPI Python. Captura faces via Expo Camera, processa com OpenCV LBPH e registra a presença no SQLite.
Deep Lake é um banco de dados serverless multimodal para IA que combina busca vetorial com armazenamento de embeddings, imagens, vídeo, áudio e documentos. Ele transmite dados diretamente do armazenamento em nuvem para PyTorch/TensorFlow, suporta versionamento e integra-se com LangChain, LlamaIndex e Weights & Biases.
A Ultralytics oferece um conjunto de modelos YOLO de última geração para tarefas de visão computacional, incluindo detecção de objetos, segmentação e classificação.
OpenCV é uma biblioteca de visão computacional de código aberto que oferece uma ampla gama de ferramentas para processamento de imagem e análise visual.
Um currículo gratuito de 12 semanas e 24 lições da Microsoft para aprender fundamentos de IA: redes neurais, aprendizado profundo, visão computacional, PNL, transformadores, ética, além de notebooks práticos, questionários e laboratórios.
JavaCV oferece wrappers Java para OpenCV, FFmpeg e outras bibliotecas de visão computacional via JavaCPP Presets. Permite processamento de imagens, captura/gravação de vídeo, detecção de rostos e calibração de câmeras em Java e Android.
RF-DETR é uma arquitetura de transformer em tempo real da Roboflow para detecção de objetos, segmentação de instâncias e detecção de pontos-chave, baseada no backbone DINOv2 e projetada para fine-tuning.
Um bot de automação de jogo Elixir/OTP para um MMORPG 2D, usando captura de tela e entrada sintética no macOS. Possui uma frota de processos supervisionados, lógica de decisão pura e controles de atuação à prova de falhas.
Uma lista selecionada de cursos de ciência da computação com videoaulas, abrangendo algoritmos, IA, bancos de dados, sistemas operacionais e muito mais.
FaceAttend é um sistema de presença em sala de aula hospedado localmente que utiliza reconhecimento facial baseado em vídeo para identificar alunos matriculados.
jetson-inference é uma biblioteca de visão profunda em C++ e Python para NVIDIA Jetson. Usa TensorRT para inferência no dispositivo e PyTorch para treinamento, com exemplos, modelos pré-treinados e tutoriais para classificação, detecção, segmentação, pose, ação, profundidade e streaming de câmera.