इस प्रोजेक्ट के बारे में

CVAT (कंप्यूटर विज़न एनोटेशन टूल) एक डेटा एनोटेशन प्लेटफ़ॉर्म है जो कंप्यूटर विज़न और विज़ुअल AI के लिए विज़ुअल डेटासेट बनाने हेतु उपयोग होता है। यह रिपॉजिटरी CVAT कम्युनिटी के सोर्स कोड और डिप्लॉयमेंट संसाधनों को समाहित करती है, जो मुफ्त, स्व-होस्टेड ओपन-सोर्स संस्करण है। यह परियोजना 2018 से GitHub पर है और व्यावसायिक CVAT ऑनलाइन और CVAT एंटरप्राइज़ की नींव के रूप में कार्य करती है। डिप्लॉयमेंट Docker-आधारित है: रिपॉजिटरी क्लोन करें, `docker compose up -d` चलाएं, फिर एक प्रबंधन कमांड से एडमिन खाता बनाएं, और localhost:8080 (या कॉन्फ़िगर किए गए CVAT_HOST) पर वेब UI खोलें। Docker इंजन, Docker Compose और Git आवश्यक पूर्वापेक्षाएँ हैं। README में मुख्य रूप से Chromium-आधारित ब्राउज़रों के साथ परीक्षण, Firefox पर संभावित सीमाएं, और Safari/WebKit समर्थन न होने का उल्लेख है। वैकल्पिक डिप्लॉयमेंट गाइड AWS, Kubernetes, बाहरी PostgreSQL, बैकअप और अपग्रेड को कवर करते हैं। वर्णित प्रमुख क्षमताओं में छवियों, वीडियो और 3D पॉइंट क्लाउड की मैनुअल और स्वचालित लेबलिंग शामिल है, जिसमें बाउंडिंग बॉक्स, पॉलीगॉन, मास्क, कीपॉइंट, क्यूबॉइड और टैग होते हैं। स्वचालित एनोटेशन आपके अपने मॉडलों को जोड़कर काम करता है। टास्क प्रबंधन डेटासेट को प्रोजेक्ट्स, टास्क्स और जॉब्स में व्यवस्थित करता है, जिसमें असाइनमेंट और प्रगति ट्रैकिंग होती है। सहयोग सुविधाओं में संगठन, भूमिकाएं, टिप्पणियां और मुद्दे शामिल हैं। गुणवत्ता नियंत्रण में समीक्षा, मुद्दा फ़्लैगिंग, सर्वसम्मति तुलना, और सर्वर API के माध्यम से ग्राउंड ट्रुथ और हनीपॉट जांच शामिल है। एनालिटिक्स उपयोगकर्ता गतिविधि, कार्य समय, घटनाओं और सर्वर लॉग के लिए Grafana डैशबोर्ड का उपयोग करता है। डेटा संचालन CVAT XML, COCO JSON, YOLO TXT, Ultralytics YOLO, Pascal VOC, KITTI और MOT जैसे 20+ प्रारूपों में आयात/निर्यात का समर्थन करता है, साथ ही S3, Azure और Google Cloud से क्लाउड स्टोरेज कनेक्शन भी। डेवलपर टूलिंग में Python SDK (`pip install cvat-sdk`), एक कमांड लाइन टूल (`pip install cvat-cli`) और प्रोग्रामेटिक नियंत्रण के लिए REST API शामिल है। स्वचालित एनोटेशन Nuclio द्वारा संचालित एक सर्वरलेस घटक के माध्यम से सक्षम किया जा सकता है, जिसमें डिटेक्शन, सेगमेंटेशन, पोज़ अनुमान और ट्रैकिंग के लिए पूर्व-निर्मित मॉडल सूचीबद्ध हैं, जिनमें Segment Anything (SAM), Inside-Outside Guidance, RetinaNet R101, HRNet32 Whole Body Pose, TransT, YOLO v7, Mask RCNN Inception ResNet v2, Face Detection 0205 और Faster RCNN Inception v2 शामिल हैं, जो PyTorch, ONNX, OpenVINO और TensorFlow फ्रेमवर्क में हैं। README चार संस्करणों को अलग करता है: CVAT ऑनलाइन ब्राउज़र-आधारित मूल्यांकन और प्रबंधित योजनाओं के लिए, CVAT कम्युनिटी MIT-लाइसेंस प्राप्त स्व-होस्टेड विकल्प के रूप में, CVAT एंटरप्राइज़ उन संगठनों के लिए जिन्हें अपने क्लाउड डिप्लॉयमेंट, समर्थन, SSO और SLA की आवश्यकता है, और लेबलिंग सेवाएं आउटसोर्स एनोटेशन के लिए। उन्नत सुविधाएं जैसे उन्नत प्रोजेक्ट एनालिटिक्स, गुणवत्ता नियंत्रण UI, SAM 2 और SAM 3 के साथ अंतर्निहित ऑटो-लेबलिंग, AI एजेंट और SSO को सशुल्क और एंटरप्राइज़ योजनाओं में उपलब्ध बताया गया है, न कि कम्युनिटी संस्करण में। लाइसेंसिंग: कोर MIT है। `/serverless` में कोड भी MIT-लाइसेंस प्राप्त है, लेकिन यह अलग लाइसेंस के तहत तृतीय-पक्ष संसाधनों का उपयोग कर सकता है, जिनमें गैर-व्यावसायिक भी शामिल हैं। सॉफ़्टवेयर LGPL/GPL के तहत FFmpeg लाइब्रेरी का उपयोग करता है। समर्थन चैनलों में Discord, `cvat` टैग के साथ Stack Overflow, GitHub मुद्दे और दस्तावेज़ीकरण FAQ शामिल हैं। योगदान दस्तावेज़ीकरण और मुद्दा ट्रैकर के माध्यम से स्वागत किया जाता है, और संवेदनशील रिपोर्ट के लिए समर्पित संपर्क के साथ एक सुरक्षा नीति प्रदान की गई है।