프로젝트 소개
ImageBind는 FAIR 메타 AI의 멀티모달 임베딩 모델에 대한 PyTorch 구현입니다. 이미지, 텍스트, 오디오, 깊이, 열상 이미지, IMU 데이터의 여섯 가지 양식을 위한 공동 표현을 학습합니다. 공유 공간에 인코딩되면 서로 다른 양식의 임베딩을 비교할 수 있어 교차 모달 검색 및 유사성 분석이 가능합니다. 동반 연구는 산술을 통한 양식 결합, 교차 모달 탐지, 생성, 제로샷 분류와 같은 새로운 사용 사례도 설명합니다.
저장소에는 imagebind_huge 사전 학습 체크포인트, 모델 코드, 데이터 로딩 및 변환 유틸리티, 그리고 이미지, 텍스트, 오디오 임베딩을 추출하고 행렬 곱셈 및 소프트맥스 점수로 비교하는 예제가 포함되어 있습니다. ImageNet-1K, Kinetics-400, NYU Depth, ESC, LLVIP, Ego4D 벤치마크에서 제로샷 결과를 보고합니다.
설치에는 PyTorch 2.0 이상이 필요하며 제공된 Conda 예제에서는 Python 3.10이 사용됩니다. Windows 사용자는 오디오 I/O를 위해 soundfile이 추가로 필요할 수 있습니다. 코드와 모델 가중치는 상업적 사용을 제한하는 CC-BY-NC 4.0 라이선스로 배포됩니다. 이 작업은 CVPR 2023에서 하이라이트 논문으로 발표되었습니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.