Об этом проекте
PyTorch Image Models (timm) — это коллекция моделей изображений, слоёв, утилит, оптимизаторов, планировщиков, загрузчиков данных и аугментаций, а также эталонных скриптов обучения, валидации и инференса. Заявленная цель проекта — собрать широкий спектр архитектур классификации изображений и бэкбонов с возможностью воспроизведения результатов обучения на ImageNet.
Проект объединяет множество семейств архитектур, включая ResNet, ResNeXT, EfficientNet, NFNet, Vision Transformer (ViT), MobileNetV4, MobileNet-V3/V2, RegNet, DPN, CSPNet, Swin Transformer, MaxViT, CoAtNet и ConvNeXt. Он также охватывает более новые дополнения, такие как EVA, DINOv3, SigLIP-2, MobileCLIP-2, MetaCLIP-2, Perception Encoder, NaFlexViT и различные эффективные модели, ориентированные на мобильные устройства. Определения моделей сопровождаются предобученными весами, размещёнными на Hugging Face Hub, и в репозитории отмечается, что некоторые варианты намеренно поставляются без весов.
Помимо определений моделей, timm предоставляет скрипты обучения и валидации, утилиты инференса и экспорта, а также поддержку обучения с переменным разрешением и переменным соотношением сторон через конвейер NaFlex. Он включает оптимизаторы, такие как варианты AdamW, Muon, AdaMuon, NAdaMuon, Kron и другие, а также планировщики и утилиты аугментации. Недавние выпуски подчёркивают инициализацию мета-устройств, поддержку фабрик устройств/dtype, градиентную контрольную точку, улучшения экспорта ONNX и более безопасные настройки загрузки контрольных точек по умолчанию.
В README документированы частые выпуски, файлы результатов бенчмарков для измерения времени инференса на различных GPU, а также длинный список моделей, внесённых участниками, со ссылками на статьи и исходные репозитории. Также упоминается вклад многих внешних авторов и проектов.
Это библиотека и инструментарий для разработчиков и исследователей, работающих с моделями зрения PyTorch, а не конечное пользовательское приложение. Она полезна для обучения, тонкой настройки, оценки, экспорта и бенчмаркинга энкодеров изображений и бэкбонов.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.