À propos du projet
SAHI (Slicing Aided Hyper Inference) est une bibliothèque de vision légère destinée à la détection d'objets et à la segmentation d'instances à grande échelle. Son idée centrale est l'inférence découpée : diviser les grandes images en tuiles qui se chevauchent, exécuter la détection sur chaque tuile, puis fusionner les résultats, ce qui aide à faire ressortir les petits objets qu'une seule passe sur l'image entière pourrait manquer.
La bibliothèque est agnostique au framework. Le README mentionne la prise en charge des modèles Ultralytics (variantes YOLO, YOLOE, YOLO11-OBB), MMDetection, des modèles HuggingFace transformers tels que RT-DETR, TorchVision, Detectron2, YOLOv5, YOLOX, GroundingDINO et Roboflow/RF-DETR. L'installation se fait via pip, avec des extras optionnels spécifiques à chaque framework.
Une interface en ligne de commande couvre les principaux flux de travail : predict pour l'inférence découpée ou standard sur images et vidéos ; predict-fiftyone pour inspecter les résultats dans l'application FiftyOne ; coco slice pour découper les images et annotations COCO ; coco fiftyone pour parcourir les prédictions ordonnées par erreurs de détection ; coco evaluate pour le calcul des AP/AR COCO par classe ; coco analyse pour les graphiques d'analyse d'erreurs ; et coco yolo pour convertir les jeux de données COCO au format Ultralytics. Les API Python sont documentées pour la prédiction, le découpage et les utilitaires COCO.
Au-delà de l'inférence, SAHI fournit des outils pour les jeux de données : découpage, sous-échantillonnage, filtrage, fusion et division de jeux de données COCO, ainsi que la conversion au format YOLO. Les graphiques d'analyse d'erreurs et les rapports d'évaluation aident à diagnostiquer les échecs de détection, et l'intégration FiftyOne prend en charge la visualisation interactive et l'inspection des prédictions.
Le projet est publié sur PyPI et conda-forge, dispose d'un article ICIP 2022, et sa documentation est indexée pour les assistants de codage IA via Context7 MCP et un fichier llms.txt. Le README renvoie également à des notebooks et démos pour chaque framework pris en charge, à une démo HuggingFace Space, et à des ressources communautaires, notamment une liste de publications citantes et de gagnants de compétitions.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.