このプロジェクトについて

RF-DETRは、Roboflowが開発した物体検出、インスタンスセグメンテーション、キーポイント検出(プレビュー版)のためのリアルタイムトランスフォーマーアーキテクチャです。DINOv2ビジョントランスフォーマーバックボーン上に構築され、ICLR 2026論文(arXiv:2511.09554)として公開されています。このプロジェクトは、オープンソースの`rfdetr` Pythonパッケージ(Python >= 3.10、`pip install rfdetr`でインストール可能)として配布され、コアパッケージはApache 2.0ライセンス、モデルウェイトはApache指定ライセンスです。より大きなPlusコンポーネント(`rfdetr_plus`、RF-DETR-XLやRF-DETR-2XL検出モデルを含む)はPML 1.0ライセンスです。 モデルファミリーは、Nanoから2XLargeまでの複数のサイズで提供され、それぞれ異なる入力解像度とパラメータ数を持ちます。検出バリアント(RFDETRNanoからRFDETR2XLarge)は、COCO AP50値が67.6(Nano、384x384、30.5Mパラメータ、NVIDIA T4でTensorRT FP16使用時2.3msレイテンシ)から78.5(2XL、880x880、126.9Mパラメータ、17.2ms)まで報告されています。インスタンスセグメンテーションバリアント(RFDETRSegNanoからRFDETRSeg2XLarge)は、COCO AP50が63.0から73.1で、レイテンシは3.4msから21.8msです。キーポイント検出プレビューモデル(RFDETRKeypointPreview)は、COCO人物キーポイントで事前学習され、AP50:95が71.8、レイテンシは9.7msです。 README内のすべてのベンチマークは、完全な5,000画像のCOCO val2017スプリットに対するシングルアーティファクトベンチマーキング(SAB)でpycocotoolsを使用して社内で測定され、レイテンシはNVIDIA T4でTensorRT、FP16、バッチサイズ1を使用して測定されています。READMEでは、RF-DETRをYOLO11、YOLO26、LW-DETR、D-FINE、SAM 3とCOCOおよびRF100-VLデータセットの両方で比較し、公開されたRF-DETRサイズはニューラルアーキテクチャサーチ(NAS)で作成されたと述べています。同じNASメソッドはRoboflowプラットフォームで利用可能で、単一のトレーニングランで全モデルサイズが生成されます。 使用方法は簡単です:`rfdetr`からモデルクラスをインポートし、`model.predict(image, threshold=...)`を呼び出し、`supervision`ライブラリと互換性のある検出結果を取得してアノテーションを行います。モデルは`inference`ライブラリを介して`rfdetr-medium`や`rfdetr-seg-medium`などのエイリアスで実行することもできます。ファインチューニングは検出、セグメンテーション、キーポイント検出でサポートされ、Google Colabノートブックとビデオチュートリアルが提供され、トレーニングはRoboflowプラットフォームで直接実行することもできます。プロジェクトには、rfdetr.roboflow.comのドキュメントサイト、Hugging Face Spaceデモ、Discordコミュニティが含まれています。アーキテクチャは、LW-DETR、DINOv2、Deformable DETRなどの先行研究に基づいています。