프로젝트 소개
RF-DETR은 Roboflow가 개발한 객체 감지, 인스턴스 분할, 키포인트 감지(프리뷰)를 위한 실시간 트랜스포머 아키텍처입니다. DINOv2 비전 트랜스포머 백본을 기반으로 구축되었으며 ICLR 2026 논문(arXiv:2511.09554)으로 발표되었습니다. 이 프로젝트는 오픈소스 `rfdetr` Python 패키지(Python >= 3.10, `pip install rfdetr`로 설치 가능)로 배포되며, 핵심 패키지는 Apache 2.0 라이선스, 모델 가중치는 Apache 지정 라이선스를 따릅니다. 더 큰 Plus 구성 요소(`rfdetr_plus`, RF-DETR-XL 및 RF-DETR-2XL 감지 모델 포함)는 PML 1.0 라이선스로 제공됩니다.
모델 제품군은 Nano부터 2XLarge까지 다양한 크기로 제공되며, 각각 고유한 입력 해상도와 매개변수 수를 가집니다. 감지 변형(RFDETRNano부터 RFDETR2XLarge까지)은 COCO AP50 값이 67.6(Nano, 384x384, 3050만 매개변수, NVIDIA T4에서 TensorRT FP16 기준 2.3ms 지연 시간)부터 78.5(2XL, 880x880, 1억 2690만 매개변수, 17.2ms)까지 보고합니다. 인스턴스 분할 변형(RFDETRSegNano부터 RFDETRSeg2XLarge까지)은 COCO AP50이 63.0에서 73.1까지, 지연 시간은 3.4ms에서 21.8ms로 보고합니다. 키포인트 감지 프리뷰 모델(RFDETRKeypointPreview)은 COCO 사람 키포인트로 사전 학습되었으며 9.7ms 지연 시간에서 AP50:95 71.8을 보고합니다.
README의 모든 벤치마크는 전체 5,000개 이미지 COCO val2017 분할에 대해 Single Artifact Benchmarking(SAB)에서 pycocotools를 사용하여 사내에서 측정되었으며, 지연 시간은 NVIDIA T4에서 TensorRT, FP16, 배치 크기 1로 측정되었습니다. README는 RF-DETR을 YOLO11, YOLO26, LW-DETR, D-FINE, SAM 3과 COCO 및 RF100-VL 데이터셋 모두에서 비교하며, 게시된 RF-DETR 크기는 신경 아키텍처 검색(NAS)으로 생성되었음을 언급합니다. 동일한 NAS 방법은 Roboflow 플랫폼에서 사용할 수 있으며, 단일 학습 실행으로 모든 모델 크기를 생성합니다.
사용법은 간단합니다. `rfdetr`에서 모델 클래스를 가져오고 `model.predict(image, threshold=...)`를 호출하면 `supervision` 라이브러리와 호환되는 감지 결과를 얻어 주석을 달 수 있습니다. 모델은 `rfdetr-medium` 또는 `rfdetr-seg-medium` 같은 별칭을 사용하여 `inference` 라이브러리를 통해서도 실행할 수 있습니다. 감지, 분할, 키포인트 감지에 대한 미세 조정이 지원되며 Google Colab 노트북과 비디오 튜토리얼이 제공되고, Roboflow 플랫폼에서 직접 학습도 가능합니다. 프로젝트에는 rfdetr.roboflow.com 문서 사이트, Hugging Face Space 데모, Discord 커뮤니티가 포함됩니다. 이 아키텍처는 LW-DETR, DINOv2, Deformable DETR을 포함한 이전 작업을 기반으로 구축되었습니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.