Об этом проекте
RF-DETR — это архитектура трансформера реального времени для обнаружения объектов, сегментации экземпляров и обнаружения ключевых точек (предварительная версия), разработанная Roboflow. Она построена на основе vision-трансформера DINOv2 и опубликована в виде статьи ICLR 2026 (arXiv:2511.09554). Проект распространяется как открытый Python-пакет `rfdetr` (Python >= 3.10, устанавливается через `pip install rfdetr`) с лицензией Apache 2.0 для основного пакета и весами модели, обозначенными как Apache. Более крупные компоненты Plus (`rfdetr_plus`, включая модели обнаружения RF-DETR-XL и RF-DETR-2XL) лицензированы под PML 1.0.
Семейство моделей предлагается в нескольких размерах от Nano до 2XLarge, каждый с определенным разрешением входа и количеством параметров. Варианты обнаружения (RFDETRNano до RFDETR2XLarge) сообщают значения COCO AP50 от 67.6 (Nano, 384x384, 30.5M параметров, 2.3 мс задержка на NVIDIA T4 с TensorRT FP16) до 78.5 (2XL, 880x880, 126.9M параметров, 17.2 мс). Варианты сегментации экземпляров (RFDETRSegNano до RFDETRSeg2XLarge) сообщают COCO AP50 от 63.0 до 73.1 с задержками от 3.4 мс до 21.8 мс. Предварительная модель обнаружения ключевых точек (RFDETRKeypointPreview) предварительно обучена на ключевых точках людей COCO и сообщает AP50:95 71.8 при задержке 9.7 мс.
Все бенчмарки в README измерены внутри компании с использованием pycocotools в Single Artifact Benchmarking (SAB) на полном разделе COCO val2017 из 5000 изображений, с задержкой, измеренной на NVIDIA T4 с использованием TensorRT, FP16 и размера пакета 1. В README сравнивается RF-DETR с YOLO11, YOLO26, LW-DETR, D-FINE и SAM 3 как на COCO, так и на наборе данных RF100-VL, и отмечается, что опубликованные размеры RF-DETR были созданы с помощью нейронного поиска архитектуры (NAS). Тот же метод NAS доступен на платформе Roboflow, где один обучающий прогон создает все размеры моделей.
Использование простое: импортируйте класс модели из `rfdetr`, вызовите `model.predict(image, threshold=...)` и получите обнаружения, совместимые с библиотекой `supervision` для аннотации. Модели также можно запускать через библиотеку `inference`, используя псевдонимы, такие как `rfdetr-medium` или `rfdetr-seg-medium`. Тонкая настройка поддерживается для обнаружения, сегментации и обнаружения ключевых точек, с предоставленным блокнотом Google Colab и видеоуроком, а обучение также можно проводить непосредственно на платформе Roboflow. Проект включает сайт документации на rfdetr.roboflow.com, демо-пространство Hugging Face и сообщество Discord. Архитектура основана на предыдущих работах, включая LW-DETR, DINOv2 и Deformable DETR.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.