这个项目能做什么
PyTorch Image Models (timm) 是一个包含图像模型、层、工具、优化器、调度器、数据加载器和增强方法的集合,并附带了参考训练、验证和推理脚本。其既定目标是汇集多种图像分类和骨干网络架构,并能够复现 ImageNet 训练结果。该项目汇集了众多架构家族,包括 ResNet、ResNeXT、EfficientNet、NFNet、Vision Transformer (ViT)、MobileNetV4、MobileNet-V3/V2、RegNet、DPN、CSPNet、Swin Transformer、MaxViT、CoAtNet 和 ConvNeXt。它还涵盖了较新的模型,如 EVA、DINOv3、SigLIP-2、MobileCLIP-2、MetaCLIP-2、Perception Encoder、NaFlexViT,以及各种面向移动端的高效模型。模型定义与托管在 Hugging Face Hub 上的预训练权重配对,仓库说明指出某些变体有意不附带权重。除了模型定义之外,timm 还提供训练和验证脚本、推理和导出工具,并通过 NaFlex 流水线支持可变分辨率和可变宽高比训练。它包含优化器,如 AdamW 变体、Muon、AdaMuon、NAdaMuon、Kron 等,以及调度器和增强工具。最近的版本强调元设备初始化、设备/数据类型工厂支持、梯度检查点、ONNX 导出改进,以及更安全的检查点加载默认设置。README 记录了频繁的发布、各种 GPU 上推理时长的基准结果文件,以及一长串贡献模型列表,并附有论文和源代码仓库链接。它还感谢了许多外部作者和项目的贡献。这是一个面向使用 PyTorch 视觉模型的开发者和研究者的库和工具链,而非终端用户应用。它适用于训练、微调、评估、导出和基准测试图像编码器和骨干网络。
评论
0 评分人数达到10人后显示
登录后参与讨论。