À propos du projet

CVAT (Computer Vision Annotation Tool) est une plateforme d'annotation de données pour créer des ensembles visuels destinés à la vision par ordinateur et à l'IA visuelle. Ce dépôt contient le code source et les ressources de déploiement pour CVAT Community, l'édition open-source gratuite et auto-hébergée. Le projet est sur GitHub depuis 2018 et sert de base aux offres commerciales CVAT Online et CVAT Enterprise. Le déploiement repose sur Docker : clonez le dépôt, exécutez `docker compose up -d`, puis créez un compte administrateur avec une commande de gestion, et ouvrez l'interface web à localhost:8080 (ou un CVAT_HOST configuré). Docker Engine, Docker Compose et Git sont les prérequis indiqués. Le README note des tests principalement avec des navigateurs basés sur Chromium, des limitations possibles sur Firefox, et aucun support pour Safari/WebKit. Des guides de déploiement alternatifs couvrent AWS, Kubernetes, PostgreSQL externe, sauvegardes et mises à niveau. Les capacités clés décrites incluent l'annotation manuelle et automatique d'images, vidéos et nuages de points 3D avec boîtes englobantes, polygones, masques, points clés, cuboïdes et étiquettes. L'annotation automatique fonctionne en connectant vos propres modèles. La gestion des tâches organise les ensembles de données en projets, tâches et jobs avec suivi des assignations et de la progression. Les fonctionnalités de collaboration incluent organisations, rôles, commentaires et problèmes. Le contrôle qualité couvre la revue, le signalement de problèmes, la comparaison par consensus, et les vérifications Ground Truth et Honeypot via l'API serveur. Les analyses utilisent des tableaux de bord Grafana pour l'activité des utilisateurs, le temps de travail, les événements et les journaux serveur. Les opérations de données prennent en charge l'import/export dans plus de 20 formats tels que CVAT XML, COCO JSON, YOLO TXT, Ultralytics YOLO, Pascal VOC, KITTI et MOT, plus des connexions de stockage cloud à S3, Azure et Google Cloud. Les outils développeur incluent un SDK Python (`pip install cvat-sdk`), un outil en ligne de commande (`pip install cvat-cli`) et une API REST pour le contrôle programmatique. L'annotation automatique peut être activée via un composant serverless propulsé par Nuclio, avec des modèles pré-construits listés pour la détection, la segmentation, l'estimation de pose et le suivi, incluant Segment Anything (SAM), Inside-Outside Guidance, RetinaNet R101, HRNet32 Whole Body Pose, TransT, YOLO v7, Mask RCNN Inception ResNet v2, Face Detection 0205 et Faster RCNN Inception v2, sur les frameworks PyTorch, ONNX, OpenVINO et TensorFlow. Le README distingue quatre éditions : CVAT Online pour l'évaluation basée navigateur et les plans gérés, CVAT Community comme option auto-hébergée sous licence MIT, CVAT Enterprise pour les organisations nécessitant un déploiement dans leur propre cloud, support, SSO et SLA, et Labeling Services pour l'annotation externalisée. Des fonctionnalités avancées telles que les analyses de projet avancées, l'interface de contrôle qualité, l'auto-étiquetage intégré avec SAM 2 et SAM 3, les agents IA et SSO sont décrites comme disponibles dans les plans payants et entreprise plutôt que dans l'édition communautaire. Licence : le cœur est sous MIT. Le code dans `/serverless` est également sous licence MIT mais peut utiliser des ressources tierces sous licences séparées, y compris non commerciales. Le logiciel utilise les bibliothèques FFmpeg sous LGPL/GPL. Les canaux de support incluent Discord, Stack Overflow avec la balise `cvat`, GitHub Issues, et la FAQ de la documentation. Les contributions sont bienvenues via la documentation de contribution et le suivi de problèmes, et une politique de sécurité est fournie avec un contact dédié pour les rapports sensibles.