このプロジェクトについて
Qwen3-VLは、Alibaba CloudのQwenチームによるマルチモーダル大規模言語モデルシリーズです。このリポジトリには、モデルファミリー、その機能、アーキテクチャの更新、ベンチマーク、クックブック、およびTransformersとModelScopeを使用した推論のためのクイックスタートコードが文書化されています。
モデルファミリーとリリース
このシリーズは、エッジからクラウドまでスケールすると説明される、複数のサイズとアーキテクチャにわたります。リリースされたチェックポイントには、Qwen3-VL-2B、4B、8B、32B、30B-A3B、235B-A22Bがあり、それぞれInstruct版とThinking版が提供されています。FP8バージョンもリストされています。ニュースセクションで言及されている以前の世代には、Qwen2.5-VL、Qwen2-VL、QvQ-72B-Previewが含まれます。
文書化された機能
・ビジュアルエージェント動作: 要素を認識し、機能を理解し、ツールを呼び出し、タスクを完了することで、PCおよびモバイルGUIを操作します。
・ビジュアルコーディング: 画像または動画からDraw.io、HTML、CSS、JSを生成します。
・空間認識: オブジェクトの位置、視点、遮蔽を判断し、空間推論と具現化AIのための2Dグラウンディングおよび3Dグラウンディングを備えます。
・長いコンテキストと動画: ネイティブ256Kコンテキストは1Mまで拡張可能で、書籍や数時間の動画を秒単位のインデックスで処理します。
・マルチモーダル推論: 因果分析と証拠に基づく回答によるSTEMおよび数学タスク。
・視覚認識: 有名人、アニメ、製品、ランドマーク、動植物を広範にカバーする事前学習。
・OCR: 32言語をサポートし、低照度、ぼやけ、傾きに対する堅牢性に加え、長文書の構造解析を備えます。
・テキスト理解は、テキストと視覚の融合により純粋なLLMと同等と説明されています。
アーキテクチャの更新
READMEには3つのアーキテクチャ要素がリストされています: 時間、幅、高さにわたる全周波数位置割り当てのためのInterleaved-MRoPE、マルチレベルViT特徴を融合するためのDeepStack、および動画内のタイムスタンプに基づくイベント位置特定のためのText-Timestamp Alignmentです。
クックブック
一連のJupyterノートブックは、オムニ認識、文書解析、2Dグラウンディング、OCRとキー情報抽出、動画理解、モバイルエージェント、コンピュータ使用エージェント、3Dグラウンディング、画像による思考、マルチモーダルコーディング、長文書理解、空間理解をカバーしています。それぞれにColabバッジがリンクされています。
クイックスタート
使用にはtransformers >= 4.57.0が必要です。例では、AutoModelForImageTextToTextとAutoProcessorを使用したロード、チャットテンプレートの適用、出力の生成を示しています。追加セクションでは、複数画像推論、動画推論、左パディングによるバッチ推論、およびfpsとnum_frames設定を含む画像と動画のための公式プロセッサによるピクセル予算制御をカバーしています。qwen-vl-utilsツールキット(バージョン0.0.14)は、image_patch_sizeとreturn_video_metadataオプションとともに文書化されています。
リソース
リポジトリは、Qwen Chat、Hugging FaceおよびModelScopeコレクション、ブログ記事、arXiv論文、デモSpace、WeChat、Discord、APIリファレンス、PAI-DSWへのリンクを提供しています。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.