Sobre el proyecto
PyTorch Image Models (timm) es una colección de modelos de imágenes, capas, utilidades, optimizadores, schedulers, cargadores de datos y aumentos, además de scripts de referencia para entrenamiento, validación e inferencia. Su objetivo declarado es reunir una amplia variedad de arquitecturas de clasificación de imágenes y backbones con la capacidad de reproducir los resultados de entrenamiento de ImageNet.
El proyecto agrupa muchas familias de arquitecturas, incluyendo ResNet, ResNeXT, EfficientNet, NFNet, Vision Transformer (ViT), MobileNetV4, MobileNet-V3/V2, RegNet, DPN, CSPNet, Swin Transformer, MaxViT, CoAtNet y ConvNeXt. También cubre incorporaciones más recientes como EVA, DINOv3, SigLIP-2, MobileCLIP-2, MetaCLIP-2, Perception Encoder, NaFlexViT y varios modelos eficientes orientados a dispositivos móviles. Las definiciones de modelos se acompañan de pesos preentrenados alojados en Hugging Face Hub, y el repositorio señala que algunas variantes se distribuyen intencionalmente sin pesos.
Más allá de las definiciones de modelos, timm proporciona scripts de entrenamiento y validación, utilidades de inferencia y exportación, y soporte para entrenamiento de resolución y aspecto variable mediante el pipeline NaFlex. Incluye optimizadores como variantes de AdamW, Muon, AdaMuon, NAdaMuon, Kron y otros, junto con schedulers y utilidades de aumento. Las versiones recientes enfatizan la inicialización meta-dispositivo, soporte de fábrica de dispositivo/dtype, gradient checkpointing, mejoras en la exportación a ONNX y valores predeterminados más seguros para la carga de checkpoints.
El README documenta lanzamientos frecuentes, archivos de resultados de benchmarks para tiempos de inferencia en varias GPUs, y una larga lista de modelos contribuidos con enlaces a artículos y repositorios fuente. También reconoce las contribuciones de muchos autores y proyectos externos.
Esta es una biblioteca y cadena de herramientas para desarrolladores e investigadores que trabajan con modelos de visión de PyTorch, más que una aplicación para usuarios finales. Es útil para entrenar, ajustar, evaluar, exportar y comparar codificadores de imágenes y backbones.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.