Об этом проекте
SAM 2 (Segment Anything Model 2) — это фундаментальная модель от Meta AI / FAIR для сегментации изображений и видео по подсказкам. Она расширяет подход оригинального SAM, рассматривая изображение как видео из одного кадра, используя архитектуру трансформера с потоковой памятью для обработки видео в реальном времени. Репозиторий предоставляет официальный код для вывода, загружаемые обученные контрольные точки, примеры ноутбуков, код для обучения и тонкой настройки, а также локально развертываемое веб-демо.
Ключевые возможности, описанные в README:
- Предсказание изображений: класс SAM2ImagePredictor предлагает интерфейс, аналогичный SAM, для сегментации на статических изображениях по подсказкам, включая автоматическую генерацию масок.
- Предсказание видео: видеопредсказатель поддерживает добавление точечных или прямоугольных подсказок, их уточнение и распространение масок по видео, с отслеживанием нескольких объектов и состоянием вывода для каждого объекта.
- Контрольные точки модели: контрольные точки SAM 2.1 (tiny, small, base_plus, large), выпущенные в сентябре 2024 года, а также более ранние контрольные точки SAM 2 от июля 2024 года, с указанными размерами, скоростью и показателями бенчмарков на SA-V, MOSE и LVOS v2.
- Загрузка из Hugging Face: модели можно загружать через from_pretrained для предсказателей изображений и видео.
- Обучение и тонкая настройка: предоставлен код для обучения или тонкой настройки на пользовательских наборах данных изображений, видео или смешанных.
- Веб-демо: код фронтенда и бэкенда для локально развертываемого демо, аналогичного размещенному демо SAM 2.
- Набор данных SA-V: крупнейший на сегодняшний день набор данных для сегментации видео, созданный с помощью механизма данных с участием модели; включена документация по набору данных.
Установка требует Python 3.10+, PyTorch 2.5.1+ и TorchVision 0.20.1+, а также CUDA toolkit для компиляции пользовательского ядра; пользователям Windows рекомендуется использовать WSL. Дополнительные опции устанавливают Jupyter и matplotlib для ноутбуков. В README отмечается, что неудачную сборку расширения CUDA можно игнорировать, это лишь ограниченно повлияет на постобработку. В обновлении декабря 2024 года добавлена полная компиляция модели для ускорения сегментации видеообъектов и обновленный SAM2VideoPredictor, поддерживающий независимый вывод для каждого объекта и добавление новых объектов после начала отслеживания.
Лицензирование: контрольные точки модели, демонстрационный код и код обучения распространяются под лицензией Apache 2.0, шрифты Inter Font и Noto Color Emoji — под лицензией SIL Open Font License 1.1. Сторонний код для связных компонентов на GPU адаптирован из cc_torch с собственным файлом лицензии.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.