Sobre el proyecto
VLMEvalKit (nombre del paquete de Python vlmeval) es un kit de herramientas de evaluación de código abierto para grandes modelos de visión-lenguaje (LVLM). Su propósito declarado es permitir a investigadores y desarrolladores ejecutar evaluación con un solo comando de LVLM en muchos benchmarks sin preparar datos por separado para cada repositorio. El README informa compatibilidad con más de 220 LMM y más de 80 benchmarks, cubriendo API comerciales y modelos de código abierto.
Enfoque de evaluación: el kit utiliza evaluación basada en generación para todos los LVLM y proporciona resultados tanto de coincidencia exacta como de extracción de respuestas mediante LLM. El README señala que no está destinado a reproducir números exactos de precisión de los artículos originales de benchmarks de terceros, porque algunos benchmarks usan paradigmas diferentes (por ejemplo, evaluación basada en PPL) y porque se usa una única plantilla de prompt predeterminada en todos los modelos, a menos que se implemente una plantilla específica para el modelo.
Contenido compatible: el README enumera benchmarks de imagen y video (más de 70 según la tabla de características) y LMM compatibles (más de 200), incluidos Qwen, InternVL, LLaVA, MiniCPM, Ovis, Gemini, Kimi-VL, LLaMA4, Phi, Grok y otros. Entre las incorporaciones recientes mencionadas se incluyen Video-MME-v2, SeePhys, PhyX, InternVL3, Qwen2.5-VL, MMMU-Pro, CC-OCR y muchos más.
Inicio rápido: una breve demostración en Python muestra cómo importar supported_VLM desde vlmeval.config, instanciar un modelo como idefics_9b_instruct y llamar a generate con rutas de imágenes más una pregunta. El README también remite a las guías Quickstart y Development en inglés y chino.
Modelo de desarrollo: para añadir un modelo, un desarrollador implementa una única función generate_inner(); la descarga de datos, el preprocesamiento, la inferencia de predicción y el cálculo de métricas son gestionados por el código base. Se reconocen las contribuciones de modelos, benchmarks o características importantes, y los contribuyentes con tres o más contribuciones importantes pueden unirse a la lista de autores del informe técnico.
Notas operativas: el README recomienda versiones específicas de transformers para diferentes familias de modelos, además de orientación sobre torchvision y flash-attn. Documenta variables de entorno para modelos en modo pensamiento (SPLIT_THINK), respuestas largas (PRED_FORMAT=tsv para evitar el truncamiento de celdas en xlsx) e inferencia distribuida en múltiples nodos mediante LMDeploy o VLLM para modelos a gran escala o de pensamiento. Los resultados de evaluación se publican en los leaderboards de OpenVLM y espacios de Hugging Face, con resultados detallados descargables. El proyecto está asociado con un artículo de ACM Multimedia 2024 y una comunidad de Discord.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.