Sobre o projeto

Qwen3-VL é a série de modelos de linguagem multimodal de grande escala da equipe Qwen da Alibaba Cloud. O repositório documenta a família de modelos, suas capacidades, atualizações de arquitetura, benchmarks, cookbooks e código de início rápido para inferência com Transformers e ModelScope. Família de modelos e lançamentos A série abrange vários tamanhos e arquiteturas, descritos como escalando da borda para a nuvem. Os checkpoints lançados incluem Qwen3-VL-2B, 4B, 8B, 32B, 30B-A3B e 235B-A22B, cada um oferecido nas edições Instruct e Thinking. Versões FP8 também estão listadas. Gerações anteriores mencionadas na seção de notícias incluem Qwen2.5-VL, Qwen2-VL e QvQ-72B-Preview. Capacidades documentadas - Comportamento de agente visual: operar GUIs de PC e celular reconhecendo elementos, entendendo funções, invocando ferramentas e concluindo tarefas. - Codificação visual: gerar Draw.io, HTML, CSS e JS a partir de imagens ou vídeos. - Percepção espacial: julgar posições de objetos, pontos de vista e oclusões, com grounding 2D e grounding 3D para raciocínio espacial e IA incorporada. - Contexto longo e vídeo: contexto nativo de 256K expansível para 1M, lidando com livros e vídeos de horas com indexação em nível de segundo. - Raciocínio multimodal: tarefas de STEM e matemática com análise causal e respostas baseadas em evidências. - Reconhecimento visual: ampla cobertura de pré-treinamento para celebridades, anime, produtos, pontos turísticos e flora/fauna. - OCR: suporte para 32 idiomas, robustez em pouca luz, desfoque e inclinação, além de análise de estrutura de documentos longos. - Compreensão de texto descrita como equivalente a LLMs puros por meio da fusão texto-visão. Atualizações de arquitetura O README lista três elementos arquiteturais: Interleaved-MRoPE para alocação posicional de frequência total em tempo, largura e altura; DeepStack para fundir características ViT de múltiplos níveis; e Text-Timestamp Alignment para localização de eventos com base em timestamp em vídeo. Cookbooks Um conjunto de notebooks Jupyter cobre reconhecimento omni, análise de documentos, grounding 2D, OCR e extração de informações-chave, compreensão de vídeo, agente móvel, agente de uso de computador, grounding 3D, pensamento com imagens, codificação multimodal, compreensão de documentos longos e compreensão espacial. Cada um está vinculado a um selo Colab. Início rápido O uso requer transformers >= 4.57.0. Os exemplos mostram carregamento com AutoModelForImageTextToText e AutoProcessor, aplicando um template de chat e gerando saída. Seções adicionais cobrem inferência com múltiplas imagens, inferência de vídeo, inferência em lote com padding à esquerda e controle de orçamento de pixels por meio do processador oficial para imagens e vídeos, incluindo configurações de fps e num_frames. O kit de ferramentas qwen-vl-utils (versão 0.0.14) é documentado com as opções image_patch_size e return_video_metadata. Recursos O repositório vincula a Qwen Chat, coleções Hugging Face e ModelScope, uma postagem de blog, um artigo arXiv, um Space de demonstração, WeChat, Discord, uma referência de API e PAI-DSW.