À propos du projet

Qwen3-VL est la série de grands modèles de langage multimodaux de l'équipe Qwen chez Alibaba Cloud. Le dépôt documente la famille de modèles, ses capacités, les mises à jour d'architecture, les benchmarks, les cookbooks et le code de démarrage rapide pour l'inférence avec Transformers et ModelScope. Famille de modèles et versions La série couvre plusieurs tailles et architectures, décrites comme évoluant de la périphérie au cloud. Les checkpoints publiés incluent Qwen3-VL-2B, 4B, 8B, 32B, 30B-A3B et 235B-A22B, chacun proposé en éditions Instruct et Thinking. Les versions FP8 sont également listées. Les générations antérieures mentionnées dans la section actualités incluent Qwen2.5-VL, Qwen2-VL et QvQ-72B-Preview. Capacités documentées - Comportement d'agent visuel : utilisation d'interfaces graphiques PC et mobiles en reconnaissant les éléments, en comprenant les fonctions, en invoquant des outils et en accomplissant des tâches. - Codage visuel : génération de Draw.io, HTML, CSS et JS à partir d'images ou de vidéos. - Perception spatiale : évaluation des positions d'objets, des points de vue et des occlusions, avec ancrage 2D et ancrage 3D pour le raisonnement spatial et l'IA incarnée. - Contexte long et vidéo : contexte natif de 256K extensible à 1M, prenant en charge des livres et des vidéos de plusieurs heures avec indexation à la seconde. - Raisonnement multimodal : tâches STEM et mathématiques avec analyse causale et réponses fondées sur des preuves. - Reconnaissance visuelle : large couverture de pré-entraînement pour les célébrités, l'anime, les produits, les monuments et la flore/faune. - OCR : prise en charge de 32 langues, robustesse en faible luminosité, flou et inclinaison, plus analyse de la structure des documents longs. - Compréhension de texte décrite comme comparable aux LLM purs grâce à la fusion texte-vision. Mises à jour d'architecture Le README liste trois éléments architecturaux : Interleaved-MRoPE pour l'allocation positionnelle pleine fréquence sur le temps, la largeur et la hauteur ; DeepStack pour fusionner les caractéristiques ViT multi-niveaux ; et Text-Timestamp Alignment pour la localisation d'événements ancrée sur des horodatages dans la vidéo. Cookbooks Un ensemble de notebooks Jupyter couvre la reconnaissance omni, l'analyse de documents, l'ancrage 2D, l'OCR et l'extraction d'informations clés, la compréhension vidéo, l'agent mobile, l'agent d'utilisation d'ordinateur, l'ancrage 3D, la réflexion avec images, le codage multimodal, la compréhension de documents longs et la compréhension spatiale. Chacun est associé à un badge Colab. Démarrage rapide L'utilisation nécessite transformers >= 4.57.0. Les exemples montrent le chargement avec AutoModelForImageTextToText et AutoProcessor, l'application d'un template de chat et la génération de sortie. Des sections supplémentaires couvrent l'inférence multi-images, l'inférence vidéo, l'inférence par lots avec padding à gauche et le contrôle du budget de pixels via le processeur officiel pour les images et les vidéos, y compris les paramètres fps et num_frames. La boîte à outils qwen-vl-utils (version 0.0.14) est documentée avec les options image_patch_size et return_video_metadata. Ressources Le dépôt renvoie à Qwen Chat, aux collections Hugging Face et ModelScope, à un article de blog, à un article arXiv, à un Space de démo, WeChat, Discord, une référence API et PAI-DSW.