프로젝트 소개
Qwen3-VL은 Alibaba Cloud의 Qwen 팀이 개발한 멀티모달 대규모 언어 모델 시리즈입니다. 이 저장소는 모델 제품군, 기능, 아키텍처 업데이트, 벤치마크, 쿡북, 그리고 Transformers 및 ModelScope를 사용한 추론을 위한 퀵스타트 코드를 문서화합니다.
모델 제품군 및 릴리스
이 시리즈는 엣지부터 클라우드까지 확장되는 것으로 설명되는 다양한 크기와 아키텍처를 포괄합니다. 릴리스된 체크포인트로는 Qwen3-VL-2B, 4B, 8B, 32B, 30B-A3B, 235B-A22B가 있으며, 각각 Instruct 및 Thinking 에디션으로 제공됩니다. FP8 버전도 나열되어 있습니다. 뉴스 섹션에서 언급된 이전 세대에는 Qwen2.5-VL, Qwen2-VL, QvQ-72B-Preview가 포함됩니다.
문서화된 기능
- 비주얼 에이전트 동작: 요소 인식, 기능 이해, 도구 호출, 작업 완료를 통해 PC 및 모바일 GUI를 조작합니다.
- 비주얼 코딩: 이미지나 비디오에서 Draw.io, HTML, CSS, JS를 생성합니다.
- 공간 인식: 객체 위치, 시점, 가림(occlusion)을 판단하며, 공간 추론 및 구현 AI(embodied AI)를 위한 2D 그라운딩과 3D 그라운딩을 제공합니다.
- 긴 컨텍스트 및 비디오: 기본 256K 컨텍스트를 1M까지 확장 가능하며, 책과 수 시간 분량의 비디오를 초 단위 인덱싱으로 처리합니다.
- 멀티모달 추론: 인과 분석과 증거 기반 답변을 통해 STEM 및 수학 작업을 수행합니다.
- 비주얼 인식: 유명인, 애니메이션, 제품, 랜드마크, 동식물에 대한 광범위한 사전 학습 범위를 제공합니다.
- OCR: 32개 언어를 지원하며, 저조도, 흐림, 기울어짐에 강하고, 긴 문서 구조 파싱도 지원합니다.
- 텍스트 이해는 텍스트-비전 융합을 통해 순수 LLM과 동등한 수준으로 설명됩니다.
아키텍처 업데이트
README에는 세 가지 아키텍처 요소가 나열되어 있습니다: 시간, 너비, 높이에 걸쳐 전 주파수 위치 할당을 위한 Interleaved-MRoPE, 다중 레벨 ViT 특징을 융합하는 DeepStack, 그리고 비디오에서 타임스탬프 기반 이벤트 위치 파악을 위한 Text-Timestamp Alignment입니다.
쿡북
일련의 Jupyter 노트북은 옴니 인식, 문서 파싱, 2D 그라운딩, OCR 및 핵심 정보 추출, 비디오 이해, 모바일 에이전트, 컴퓨터 사용 에이전트, 3D 그라운딩, 이미지 기반 사고, 멀티모달 코딩, 긴 문서 이해, 공간 이해를 다룹니다. 각각은 Colab 배지로 연결됩니다.
퀵스타트
사용하려면 transformers >= 4.57.0이 필요합니다. 예제에서는 AutoModelForImageTextToText 및 AutoProcessor로 로드하고, 채팅 템플릿을 적용한 다음 출력을 생성하는 방법을 보여줍니다. 추가 섹션에서는 다중 이미지 추론, 비디오 추론, 왼쪽 패딩을 사용한 배치 추론, 그리고 이미지 및 비디오에 대한 공식 프로세서를 통한 픽셀 예산 제어(fps 및 num_frames 설정 포함)를 다룹니다. qwen-vl-utils 툴킷(버전 0.0.14)은 image_patch_size 및 return_video_metadata 옵션과 함께 문서화되어 있습니다.
리소스
이 저장소는 Qwen Chat, Hugging Face 및 ModelScope 컬렉션, 블로그 게시물, arXiv 논문, 데모 Space, WeChat, Discord, API 참조, PAI-DSW로 연결됩니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.