Sobre el proyecto
Qwen3-VL es la serie de modelos de lenguaje grandes multimodales del equipo Qwen en Alibaba Cloud. El repositorio documenta la familia de modelos, sus capacidades, actualizaciones de arquitectura, puntos de referencia, cookbooks y código de inicio rápido para inferencia con Transformers y ModelScope.
Familia de modelos y lanzamientos
La serie abarca múltiples tamaños y arquitecturas, descrita como escalable desde el borde hasta la nube. Los checkpoints publicados incluyen Qwen3-VL-2B, 4B, 8B, 32B, 30B-A3B y 235B-A22B, cada uno ofrecido en ediciones Instruct y Thinking. También se listan versiones FP8. Las generaciones anteriores mencionadas en la sección de noticias incluyen Qwen2.5-VL, Qwen2-VL y QvQ-72B-Preview.
Capacidades documentadas
- Comportamiento de agente visual: operar interfaces gráficas de PC y móvil reconociendo elementos, comprendiendo funciones, invocando herramientas y completando tareas.
- Codificación visual: generar Draw.io, HTML, CSS y JS a partir de imágenes o videos.
- Percepción espacial: juzgar posiciones de objetos, puntos de vista y oclusiones, con anclaje 2D y anclaje 3D para razonamiento espacial e IA encarnada.
- Contexto largo y video: contexto nativo de 256K expandible a 1M, manejando libros y videos de horas con indexación de nivel de segundo.
- Razonamiento multimodal: tareas de STEM y matemáticas con análisis causal y respuestas basadas en evidencia.
- Reconocimiento visual: amplia cobertura de preentrenamiento para celebridades, anime, productos, lugares emblemáticos y flora/fauna.
- OCR: soporte para 32 idiomas, robustez en condiciones de poca luz, desenfoque e inclinación, además de análisis de estructura de documentos largos.
- Comprensión de texto descrita como a la par de LLMs puros mediante fusión de texto y visión.
Actualizaciones de arquitectura
El README enumera tres elementos arquitectónicos: Interleaved-MRoPE para asignación posicional de frecuencia completa en tiempo, ancho y alto; DeepStack para fusionar características ViT de múltiples niveles; y Text-Timestamp Alignment para localización de eventos con marca de tiempo en video.
Cookbooks
Un conjunto de cuadernos Jupyter cubre reconocimiento omni, análisis de documentos, anclaje 2D, OCR y extracción de información clave, comprensión de video, agente móvil, agente de uso de computadora, anclaje 3D, pensamiento con imágenes, codificación multimodal, comprensión de documentos largos y comprensión espacial. Cada uno está enlazado con una insignia de Colab.
Inicio rápido
El uso requiere transformers >= 4.57.0. Los ejemplos muestran carga con AutoModelForImageTextToText y AutoProcessor, aplicación de una plantilla de chat y generación de salida. Secciones adicionales cubren inferencia con múltiples imágenes, inferencia de video, inferencia por lotes con padding a la izquierda y control del presupuesto de píxeles a través del procesador oficial para imágenes y videos, incluyendo configuraciones de fps y num_frames. El kit de herramientas qwen-vl-utils (versión 0.0.14) está documentado con opciones de image_patch_size y return_video_metadata.
Recursos
El repositorio enlaza a Qwen Chat, colecciones de Hugging Face y ModelScope, una publicación de blog, un artículo en arXiv, un Space de demostración, WeChat, Discord, una referencia de API y PAI-DSW.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.