프로젝트 소개
SAM 2(Segment Anything Model 2)는 Meta AI / FAIR에서 개발한 기반 모델로, 이미지와 비디오 모두에서 프롬프트 기반 시각적 분할을 지원합니다. 이미지를 단일 프레임 비디오로 취급하여 원래 SAM 접근 방식을 확장했으며, 실시간 비디오 처리를 위해 스트리밍 메모리를 갖춘 트랜스포머 아키텍처를 사용합니다. 이 저장소는 공식 추론 코드, 다운로드 가능한 학습된 체크포인트, 예제 노트북, 학습/미세 조정 코드, 로컬 배포 가능한 웹 데모를 제공합니다.
README에 설명된 주요 기능:
- 이미지 예측: SAM2ImagePredictor 클래스는 정적 이미지에 대한 프롬프트 기반 분할을 위해 SAM과 유사한 인터페이스를 제공하며, 자동 마스크 생성도 포함합니다.
- 비디오 예측: 비디오 예측기는 포인트 또는 박스 프롬프트 추가, 정제, 비디오 전체에 걸친 마스크릿 전파를 지원하며, 다중 객체 추적 및 객체별 추론 상태를 제공합니다.
- 모델 체크포인트: 2024년 9월에 공개된 SAM 2.1 체크포인트(tiny, small, base_plus, large)와 2024년 7월의 이전 SAM 2 체크포인트를 제공하며, SA-V, MOSE, LVOS v2에 대한 크기, 속도, 벤치마크 수치가 포함되어 있습니다.
- Hugging Face 로딩: 이미지 및 비디오 예측기 모두 from_pretrained를 통해 모델을 로드할 수 있습니다.
- 학습 및 미세 조정: 사용자 정의 이미지, 비디오 또는 혼합 데이터셋에서 학습하거나 미세 조정할 수 있는 코드가 제공됩니다.
- 웹 데모: 호스팅된 SAM 2 데모와 유사한 로컬 배포 가능한 데모를 위한 프론트엔드 및 백엔드 코드를 제공합니다.
- SA-V 데이터셋: 현재까지 가장 큰 비디오 분할 데이터셋으로, 모델 인 더 루프 데이터 엔진으로 구축되었으며 데이터셋 문서가 포함되어 있습니다.
설치에는 Python 3.10+, PyTorch 2.5.1+, TorchVision 0.20.1+가 필요하며, 사용자 정의 커널 컴파일을 위해 CUDA 툴킷이 필요합니다. Windows 사용자는 WSL을 사용하는 것이 좋습니다. 선택적 추가 기능으로 노트북용 Jupyter와 matplotlib를 설치할 수 있습니다. README에는 CUDA 확장 빌드 실패를 무시해도 되며 제한된 후처리 영향만 있다고 명시되어 있습니다. 2024년 12월 업데이트에서는 비디오 객체 분할 가속을 위한 전체 모델 컴파일과, 객체별 독립 추론 및 추적 시작 후 새 객체 추가를 지원하는 업데이트된 SAM2VideoPredictor가 추가되었습니다.
라이선스: 모델 체크포인트, 데모 코드 및 학습 코드는 Apache 2.0에 따라 제공되며, Inter Font와 Noto Color Emoji는 SIL Open Font License 1.1에 따라 제공됩니다. 타사 GPU 연결 컴포넌트 코드는 cc_torch에서 각색되었으며 자체 라이선스 파일이 있습니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.