这个项目能做什么
Qwen3-VL是阿里云通义千问团队的视觉语言大模型系列。该仓库文档涵盖了模型家族及其能力、架构更新、基准测试、示例 notebooks 以及使用 Transformers 和 ModelScope 进行推理的快速入门代码。
模型家族与版本发布
该系列覆盖多种尺寸与架构,从边缘到云端均可适配。已发布的 checkpoint 包括 Qwen3-VL-2B、4B、8B、32B、30B-A3B 和 235B-A22B,每个型号均提供 Instruct 和 Thinking 两个版本。FP8 版本也已列出。早期代际在新闻部分中提及的有 Qwen2.5-VL、Qwen2-VL 及 QvQ-72B-Preview。
已记录的能力
- 视觉智能体行为:通过识别 GUI 元素、理解功能、调用工具来完成 PC 和移动设备上的任务。
- 视觉编程:根据图片或视频生成 Draw.io、HTML、CSS 和 JS 代码。
- 空间感知:判断物体位置、视角和遮挡关系,支持 2D 定位和 3D 定位,用于空间推理与具身智能。
- 长上下文与视频:原生支持 256K 上下文,可扩展至 1M,可处理书籍和长达数小时的视频,并支持秒级索引。
- 多模态推理:对 STEM 和数学任务进行因果分析与基于证据的回答。
- 视觉识别:广泛的预训练覆盖,包括名人、动漫、产品、地标及动植物。
- OCR:支持 32 种语言,在低光照、模糊和倾斜场景下表现稳健,并支持长文档结构解析。
- 文本理解:通过文本-视觉融合,能力与纯 LLM 相当。
架构更新
README 列出了三项架构改进:Interleaved-MRoPE 实现跨时间、宽度和高度的全频位置编码;DeepStack 用于融合多级 ViT 特征;Text-Timestamp Alignment 实现基于时间戳的视频事件定位。
示例 Notebook
提供一系列 Jupyter notebooks,涵盖全模态识别、文档解析、2D 定位、OCR 与信息提取、视频理解、移动智能体、计算机操作智能体、3D 定位、图像思维推理、多模态编程、长文档理解和空间理解,每个均附有 Colab 快捷入口。
快速入门
需使用 transformers >= 4.57.0。示例展示如何通过 AutoModelForImageTextToText 和 AutoProcessor 加载模型、应用对话模板并生成输出。其余章节涵盖多图推理、视频推理、使用左填充的批量推理,以及通过官方 processor 控制图像和视频的像素预算(含 fps 和 num_frames 设置)。qwen-vl-utils 工具包(版本 0.0.14)记录了 image_patch_size 和 return_video_metadata 选项。
相关资源
仓库链接包括 Qwen Chat、Hugging Face 和 ModelScope 模型集、博客文章、arXiv 论文、演示 Space、微信、Discord、API 参考文档及 PAI-DSW。
评论
0 评分人数达到10人后显示
登录后参与讨论。