इस प्रोजेक्ट के बारे में

RF-DETR रोबोफ्लो द्वारा विकसित ऑब्जेक्ट डिटेक्शन, इंस्टेंस सेगमेंटेशन और कीपॉइंट डिटेक्शन (पूर्वावलोकन) के लिए एक रीयल-टाइम ट्रांसफॉर्मर आर्किटेक्चर है। यह DINOv2 विज़न ट्रांसफॉर्मर बैकबोन पर बनाया गया है और इसे ICLR 2026 पेपर (arXiv:2511.09554) के रूप में प्रकाशित किया गया है। परियोजना को ओपन-सोर्स `rfdetr` पायथन पैकेज (पायथन >= 3.10, `pip install rfdetr` के माध्यम से स्थापित) के रूप में वितरित किया जाता है, जिसमें मुख्य पैकेज के लिए Apache 2.0 लाइसेंस और Apache-निर्दिष्ट मॉडल वेट शामिल हैं। बड़े प्लस घटक (`rfdetr_plus`, जिसमें RF-DETR-XL और RF-DETR-2XL डिटेक्शन मॉडल शामिल हैं) PML 1.0 के तहत लाइसेंस प्राप्त हैं। मॉडल परिवार नैनो से 2XLarge तक कई आकारों में पेश किया जाता है, प्रत्येक में अलग इनपुट रिज़ॉल्यूशन और पैरामीटर गणना होती है। डिटेक्शन वेरिएंट (RFDETRNano से RFDETR2XLarge तक) COCO AP50 मान 67.6 (Nano, 384x384, 30.5M पैरामीटर, NVIDIA T4 पर TensorRT FP16 के साथ 2.3 ms विलंबता) से 78.5 (2XL, 880x880, 126.9M पैरामीटर, 17.2 ms) तक रिपोर्ट करते हैं। इंस्टेंस सेगमेंटेशन वेरिएंट (RFDETRSegNano से RFDETRSeg2XLarge तक) COCO AP50 63.0 से 73.1 तक और विलंबता 3.4 ms से 21.8 ms तक रिपोर्ट करते हैं। एक कीपॉइंट डिटेक्शन पूर्वावलोकन मॉडल (RFDETRKeypointPreview) COCO व्यक्ति कीपॉइंट्स पर पूर्व-प्रशिक्षित है और 9.7 ms विलंबता पर AP50:95 71.8 रिपोर्ट करता है। README में सभी बेंचमार्क पूर्ण 5,000-छवि COCO val2017 विभाजन पर सिंगल आर्टिफैक्ट बेंचमार्किंग (SAB) में pycocotools का उपयोग करके इन-हाउस मापे जाते हैं, विलंबता NVIDIA T4 पर TensorRT, FP16 और बैच आकार 1 का उपयोग करके मापी जाती है। README RF-DETR की तुलना YOLO11, YOLO26, LW-DETR, D-FINE और SAM 3 से COCO और RF100-VL डेटासेट दोनों पर करता है, और नोट करता है कि प्रकाशित RF-DETR आकार न्यूरल आर्किटेक्चर सर्च (NAS) के साथ बनाए गए थे। वही NAS विधि रोबोफ्लो प्लेटफ़ॉर्म पर उपलब्ध है, जहां एक एकल प्रशिक्षण रन हर मॉडल आकार उत्पन्न करता है। उपयोग सीधा है: `rfdetr` से एक मॉडल क्लास आयात करें, `model.predict(image, threshold=...)` कॉल करें, और एनोटेशन के लिए `supervision` लाइब्रेरी के साथ संगत डिटेक्शन प्राप्त करें। मॉडल को `inference` लाइब्रेरी के माध्यम से `rfdetr-medium` या `rfdetr-seg-medium` जैसे उपनामों का उपयोग करके भी चलाया जा सकता है। डिटेक्शन, सेगमेंटेशन और कीपॉइंट डिटेक्शन के लिए फाइन-ट्यूनिंग समर्थित है, जिसमें Google Colab नोटबुक और वीडियो ट्यूटोरियल प्रदान किया गया है, और प्रशिक्षण सीधे रोबोफ्लो प्लेटफ़ॉर्म पर भी किया जा सकता है। परियोजना में rfdetr.roboflow.com पर एक दस्तावेज़ीकरण साइट, हगिंग फेस स्पेस डेमो और डिस्कॉर्ड समुदाय शामिल है। आर्किटेक्चर LW-DETR, DINOv2 और Deformable DETR सहित पिछले कार्यों पर आधारित है।