このプロジェクトについて

PyTorch Image Models (timm)は、画像モデル、レイヤー、ユーティリティ、オプティマイザー、スケジューラー、データローダー、データ拡張のコレクションであり、さらにリファレンス用の学習、検証、推論スクリプトも含まれます。その目標は、ImageNetの学習結果を再現できる多種多様な画像分類およびバックボーンアーキテクチャを集めることです。 このプロジェクトは、ResNet、ResNeXT、EfficientNet、NFNet、Vision Transformer (ViT)、MobileNetV4、MobileNet-V3/V2、RegNet、DPN、CSPNet、Swin Transformer、MaxViT、CoAtNet、ConvNeXtなど、多くのアーキテクチャファミリーを集約しています。また、EVA、DINOv3、SigLIP-2、MobileCLIP-2、MetaCLIP-2、Perception Encoder、NaFlexViT、さまざまな効率的なモバイル向けモデルなどの新しい追加も含まれます。モデル定義はHugging Face Hubでホストされている事前学習済みウェイトとペアになっており、リポジトリには一部のバリアントが意図的にウェイトなしで提供されることが記載されています。 モデル定義に加えて、timmは学習および検証スクリプト、推論・エクスポートユーティリティ、およびNaFlexパイプラインによる可変解像度・可変アスペクト比の学習をサポートします。AdamWのバリアント、Muon、AdaMuon、NAdaMuon、Kronなどのオプティマイザーに加え、スケジューラーやデータ拡張ユーティリティも含まれています。最近のリリースでは、メタデバイス初期化、デバイス/dtypeファクトリのサポート、勾配チェックポイント、ONNXエクスポートの改善、より安全なチェックポイント読み込みのデフォルトが重視されています。 READMEには、頻繁なリリース、さまざまなGPUでの推論時間のベンチマーク結果ファイル、および論文やソースリポジトリへのリンク付きの多数のコントリビュートモデルのリストが記載されています。また、多くの外部著者やプロジェクトからの貢献も謝辞として認めています。 これはエンドユーザー向けアプリケーションではなく、PyTorchビジョンモデルを扱う開発者や研究者のためのライブラリおよびツールチェーンです。画像エンコーダーやバックボーンの学習、ファインチューニング、評価、エクスポート、ベンチマークに役立ちます。