Sobre o projeto
PyTorch Image Models (timm) é uma coleção de modelos de imagem, camadas, utilitários, otimizadores, agendadores, carregadores de dados e augmentações, além de scripts de referência para treinamento, validação e inferência. Seu objetivo declarado é reunir uma ampla variedade de arquiteturas de classificação de imagens e backbones com a capacidade de reproduzir resultados de treinamento no ImageNet.
O projeto agrega muitas famílias de arquiteturas, incluindo ResNet, ResNeXT, EfficientNet, NFNet, Vision Transformer (ViT), MobileNetV4, MobileNet-V3/V2, RegNet, DPN, CSPNet, Swin Transformer, MaxViT, CoAtNet e ConvNeXt. Também cobre adições mais recentes, como EVA, DINOv3, SigLIP-2, MobileCLIP-2, MetaCLIP-2, Perception Encoder, NaFlexViT e vários modelos eficientes voltados para dispositivos móveis. As definições de modelo são acompanhadas por pesos pré-treinados hospedados no Hugging Face Hub, e o repositório observa que algumas variantes são distribuídas intencionalmente sem pesos.
Além das definições de modelo, o timm fornece scripts de treinamento e validação, utilitários de inferência e exportação e suporte para treinamento com resolução e proporção de aspecto variáveis por meio do pipeline NaFlex. Inclui otimizadores como variantes de AdamW, Muon, AdaMuon, NAdaMuon, Kron e outros, juntamente com agendadores e utilitários de augmentação. Lançamentos recentes enfatizam inicialização meta-device, suporte a fábrica de device/dtype, gradient checkpointing, melhorias na exportação ONNX e padrões mais seguros para carregamento de checkpoints.
O README documenta lançamentos frequentes, arquivos de resultados de benchmarks para medição de tempo de inferência em várias GPUs e uma longa lista de modelos contribuídos com links para artigos e repositórios de código-fonte. Também reconhece contribuições de muitos autores e projetos externos.
Esta é uma biblioteca e ferramenta para desenvolvedores e pesquisadores que trabalham com modelos de visão em PyTorch, e não um aplicativo para usuário final. É útil para treinar, ajustar, avaliar, exportar e comparar encoders de imagem e backbones.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.