YOLOv5 est un framework open-source de vision par ordinateur basé sur PyTorch, dédié à la détection d'objets, la segmentation d'instances et la classification. Il propose des modèles pré-entraînés, l'inférence depuis diverses sources et l'export vers ONNX, TensorRT ou CoreML.
Code ouvert. Horizons nouveaux.
Découvrez des projets open source de qualité, soumettez des projets anonymement, puis revendiquez et éditez votre propre projet.
Un peu de curiosité. Un monde de code ouvert.
THE FIRST COLLECTIONDémo de détection faciale basée sur le navigateur via face-api.js et TensorFlow.js, packagée en image Docker avec nginx, accompagnée de notes de recherche comparant les détecteurs Viola-Jones, HOG+SVM et CNN.
FiftyOne est un outil open-source pour créer des jeux de données de haute qualité et affiner des modèles d'vision par ordinateur, offrant une interface visuelle pour l'exploration, l'étiquetage, l'évaluation et la purification des données visuelles.
Une boîte à outils complète pour la vision par ordinateur offrant des blocs de construction agnostiques vis-à-vis des modèles pour le chargement des données, la visualisation et la gestion des ensembles de données.
Curriculum gratuit et open source d'ingénierie IA à partir des premiers principes : 523 leçons en 20 phases (~342 heures), couvrant des mathématiques à la production en Python, TypeScript, Rust et Julia. Chaque leçon produit un prompt, skill, agent ou serveur MCP réutilisable ; inclut un tuteur IA installable et une préparation à la certification Claude.
Une collection croissante de 61 tutoriels de vision par ordinateur couvrant des modèles de pointe comme YOLO11, SAM 3, RF-DETR et Qwen3-VL pour la détection d'objets, la segmentation, l'OCR, et plus encore.
AirSim est le simulateur open-source de Microsoft pour les drones et les voitures, construit comme un plugin Unreal Engine avec une version Unity expérimentale. Il prend en charge la simulation software-in-the-loop et hardware-in-the-loop avec PX4 et ArduPilot, et expose des API multilingues pour collecter des images et contrôler les véhicules pour la recherche en IA.
dlib est un kit complet en C++ conçu pour créer des logiciels complexes de résolution de problèmes réels grâce au machine learning et à l'analyse de données, sous licence Boost.
Label Studio est un outil open-source d'annotation de données multi-types prenant en charge l'audio, le texte, les images, la vidéo et les séries temporelles, avec une interface utilisateur simple et l'exportation vers divers formats de modèles.
Meshify est une application de détection de maillage facial en temps réel qui identifie et suit les points de repère du visage à l'aide d'OpenCV, MediaPipe et CVZone.
X-AnyLabeling est une application de bureau multiplateforme et légère pour l'annotation de données assistée par IA. Elle prend en charge le texte, les images, les vidéos et les données multimodales, avec de nombreux modèles intégrés, des outils variés et l'import/export multi-formats.
Un système local de pointage par reconnaissance faciale avec une application mobile React Native Expo et un backend FastAPI Python. Il capture les visages via Expo Camera, les traite avec OpenCV LBPH et enregistre les présences dans SQLite.
Deep Lake est une base de données multimodale sans serveur pour l'IA, combinant recherche vectorielle et stockage d'embeddings, images, vidéos, audio et documents. Elle diffuse les données directement du cloud vers PyTorch/TensorFlow, prend en charge le versionnage et s'intègre à LangChain, LlamaIndex et Weights & Biases.
Ultralytics propose une suite de modèles YOLO de pointe pour les tâches de vision par ordinateur, notamment la détection d'objets, la segmentation et la classification.
OpenCV est une bibliothèque de vision par ordinateur open-source offrant une large gamme d'outils pour le traitement d'images et l'analyse visuelle.
Un curriculum gratuit de 12 semaines et 24 leçons par Microsoft pour apprendre les fondamentaux de l'IA : réseaux de neurones, apprentissage profond, vision par ordinateur, NLP, transformers, éthique, avec notebooks pratiques, quiz et labs.
RF-DETR est une architecture de transformeur en temps réel de Roboflow pour la détection d'objets, la segmentation d'instances et la détection de points clés, basée sur un backbone DINOv2 et conçue pour le réglage fin.
jetson-inference est une bibliothèque de vision profonde en C++ et Python pour NVIDIA Jetson. Elle utilise TensorRT pour l'inférence sur appareil et PyTorch pour l'entraînement, avec des exemples, des modèles pré-entraînés et des tutoriels pour la classification, la détection, la segmentation, la pose, l'action, la profondeur et le streaming de caméra.
MediaPipe est le framework multiplateforme de Google et sa suite de solutions d'apprentissage automatique sur appareil pour les médias en direct et en streaming, couvrant les tâches de vision, de texte et d'audio sur Android, iOS, web, bureau et périphériques de pointe.
Un projet AI/ML utilisant la vision par ordinateur pour détecter des animaux comme les éléphants, le bétail et les singes dans les zones agricoles afin de prévenir les dommages aux cultures. Le README est succinct et renvoie au code source pour l'installation.