প্রকল্প সম্পর্কে

CVAT (Computer Vision Annotation Tool) হলো কম্পিউটার ভিশন এবং ভিজ্যুয়াল AI-এর জন্য ভিজ্যুয়াল ডেটাসেট তৈরির একটি ডেটা অ্যানোটেশন প্ল্যাটফর্ম। এই রিপোজিটরিতে CVAT কমিউনিটির সোর্স কোড এবং ডিপ্লয়মেন্ট অ্যাসেট রয়েছে, যা একটি ফ্রি, স্ব-হোস্টেড ওপেন-সোর্স সংস্করণ। প্রকল্পটি ২০১৮ সাল থেকে GitHub-এ রয়েছে এবং এটি বাণিজ্যিক CVAT Online ও CVAT Enterprise অফারগুলির ভিত্তি হিসেবে কাজ করে। ডিপ্লয়মেন্ট Docker-ভিত্তিক: রিপোজিটরি ক্লোন করুন, `docker compose up -d` চালান, তারপর একটি ম্যানেজমেন্ট কমান্ড দিয়ে অ্যাডমিন অ্যাকাউন্ট তৈরি করুন এবং localhost:8080 (বা কনফিগার করা CVAT_HOST) এ ওয়েব UI খুলুন। Docker Engine, Docker Compose এবং Git হলো উল্লেখিত পূর্বশর্ত। README-তে উল্লেখ করা হয়েছে যে প্রাথমিকভাবে Chromium-ভিত্তিক ব্রাউজারে পরীক্ষা করা হয়, Firefox-এ কিছু সীমাবদ্ধতা থাকতে পারে, এবং Safari/WebKit সমর্থন নেই। বিকল্প ডিপ্লয়মেন্ট গাইডে AWS, Kubernetes, বাহ্যিক PostgreSQL, ব্যাকআপ এবং আপগ্রেড অন্তর্ভুক্ত। মূল ক্ষমতাগুলির মধ্যে রয়েছে ছবি, ভিডিও এবং 3D পয়েন্ট ক্লাউডের ম্যানুয়াল ও স্বয়ংক্রিয় লেবেলিং বাউন্ডিং বক্স, পলিগন, মাস্ক, কিপয়েন্ট, কিউবয়েড এবং ট্যাগ সহ। স্বয়ংক্রিয় অ্যানোটেশন আপনার নিজস্ব মডেল সংযোগের মাধ্যমে কাজ করে। টাস্ক ম্যানেজমেন্ট ডেটাসেটকে প্রজেক্ট, টাস্ক এবং জব-এ সংগঠিত করে অ্যাসাইনমেন্ট এবং অগ্রগতি ট্র্যাকিং সহ। সহযোগিতা বৈশিষ্ট্যগুলির মধ্যে রয়েছে সংস্থা, ভূমিকা, মন্তব্য এবং ইস্যু। কোয়ালিটি কন্ট্রোল রিভিউ, ইস্যু ফ্ল্যাগিং, কনসেনসাস তুলনা এবং সার্ভার API-এর মাধ্যমে গ্রাউন্ড ট্রুথ ও হানিপট চেক কভার করে। অ্যানালিটিক্স ব্যবহারকারী কার্যকলাপ, কাজের সময়, ইভেন্ট এবং সার্ভার লগের জন্য Grafana ড্যাশবোর্ড ব্যবহার করে। ডেটা অপারেশন ২০+ ফরম্যাটে ইমপোর্ট/এক্সপোর্ট সমর্থন করে যেমন CVAT XML, COCO JSON, YOLO TXT, Ultralytics YOLO, Pascal VOC, KITTI এবং MOT, পাশাপাশি S3, Azure এবং Google Cloud-এ ক্লাউড স্টোরেজ সংযোগ। ডেভেলপার টুলিংয়ের মধ্যে রয়েছে Python SDK (`pip install cvat-sdk`), একটি কমান্ড লাইন টুল (`pip install cvat-cli`) এবং প্রোগ্রাম্যাটিক নিয়ন্ত্রণের জন্য REST API। Nuclio দ্বারা চালিত একটি সার্ভারলেস কম্পোনেন্টের মাধ্যমে স্বয়ংক্রিয় অ্যানোটেশন সক্ষম করা যায়, যেখানে ডিটেকশন, সেগমেন্টেশন, পোজ এস্টিমেশন এবং ট্র্যাকিংয়ের জন্য প্রি-বিল্ট মডেল তালিকাভুক্ত রয়েছে, যার মধ্যে Segment Anything (SAM), Inside-Outside Guidance, RetinaNet R101, HRNet32 Whole Body Pose, TransT, YOLO v7, Mask RCNN Inception ResNet v2, Face Detection 0205 এবং Faster RCNN Inception v2, PyTorch, ONNX, OpenVINO এবং TensorFlow ফ্রেমওয়ার্ক জুড়ে। README চারটি সংস্করণ আলাদা করে: CVAT Online ব্রাউজার-ভিত্তিক মূল্যায়ন এবং পরিচালিত পরিকল্পনার জন্য, CVAT কমিউনিটি MIT-লাইসেন্সযুক্ত স্ব-হোস্টেড বিকল্প হিসেবে, CVAT Enterprise সংস্থাগুলির জন্য যাদের নিজস্ব ক্লাউড ডিপ্লয়মেন্ট, সমর্থন, SSO এবং SLA প্রয়োজন, এবং লেবেলিং সার্ভিসেস আউটসোর্সড অ্যানোটেশনের জন্য। উন্নত প্রজেক্ট অ্যানালিটিক্স, কোয়ালিটি কন্ট্রোল UI, SAM 2 এবং SAM 3 সহ বিল্ট-ইন অটো-লেবেলিং, AI এজেন্ট এবং SSO-এর মতো উন্নত বৈশিষ্ট্যগুলি কমিউনিটি সংস্করণের পরিবর্তে পেইড এবং এন্টারপ্রাইজ পরিকল্পনায় উপলব্ধ বলে বর্ণনা করা হয়েছে। লাইসেন্সিং: মূল অংশটি MIT। `/serverless`-এর কোডও MIT-লাইসেন্সযুক্ত তবে তৃতীয় পক্ষের অ্যাসেটগুলি পৃথক লাইসেন্সের অধীনে ব্যবহার হতে পারে, যার মধ্যে অ-বাণিজ্যিকও রয়েছে। সফটওয়্যারটি LGPL/GPL-এর অধীনে FFmpeg লাইব্রেরি ব্যবহার করে। সমর্থন চ্যানেলগুলির মধ্যে রয়েছে Discord, `cvat` ট্যাগ সহ Stack Overflow, GitHub Issues এবং ডকুমেন্টেশন FAQ। অবদান ডকুমেন্টেশন এবং ইস্যু ট্র্যাকারের মাধ্যমে স্বাগত, এবং সংবেদনশীল রিপোর্টের জন্য একটি ডেডিকেটেড যোগাযোগ সহ একটি নিরাপত্তা নীতি প্রদান করা হয়েছে।