À propos du projet

VLMEvalKit (nom du paquet Python vlmeval) est une boîte à outils d'évaluation open source pour les grands modèles vision-langage (LVLM). Son objectif déclaré est de permettre aux chercheurs et développeurs de lancer en une seule commande l'évaluation de LVLM sur de nombreux benchmarks sans préparer les données séparément pour chaque dépôt. Le README indique la prise en charge de plus de 220 LMM et de plus de 80 benchmarks, couvrant des API commerciales et des modèles open source. Approche d'évaluation : la boîte à outils utilise une évaluation basée sur la génération pour tous les LVLM et fournit les résultats à la fois par correspondance exacte et par extraction des réponses par LLM. Le README précise qu'elle n'a pas pour but de reproduire exactement les chiffres de précision des articles originaux des benchmarks tiers, car certains benchmarks utilisent des paradigmes différents (par exemple une évaluation basée sur la PPL) et parce qu'un modèle d'invite par défaut unique est utilisé pour tous les modèles, sauf si un modèle d'invite spécifique au modèle est implémenté. Contenu pris en charge : le README liste des benchmarks image et vidéo (plus de 70 selon le tableau des fonctionnalités) et des LMM pris en charge (plus de 200), notamment Qwen, InternVL, LLaVA, MiniCPM, Ovis, Gemini, Kimi-VL, LLaMA4, Phi, Grok et d'autres. Parmi les ajouts récents mentionnés figurent Video-MME-v2, SeePhys, PhyX, InternVL3, Qwen2.5-VL, MMMU-Pro, CC-OCR et bien d'autres. Démarrage rapide : une courte démo Python montre l'import de supported_VLM depuis vlmeval.config, l'instanciation d'un modèle tel que idefics_9b_instruct et l'appel de generate avec des chemins d'images et une question. Le README renvoie également aux guides Quickstart et Development en anglais et en chinois. Modèle de développement : pour ajouter un modèle, le développeur implémente une seule fonction generate_inner() ; le téléchargement des données, le prétraitement, l'inférence de prédiction et le calcul des métriques sont gérés par la base de code. Les contributions de modèles, de benchmarks ou de fonctionnalités majeures sont reconnues, et les contributeurs ayant réalisé trois contributions majeures ou plus peuvent rejoindre la liste des auteurs du rapport technique. Notes opérationnelles : le README recommande des versions spécifiques de transformers pour différentes familles de modèles, ainsi que des conseils sur torchvision et flash-attn. Il documente des variables d'environnement pour les modèles en mode réflexion (SPLIT_THINK), les réponses longues (PRED_FORMAT=tsv pour éviter la troncature des cellules xlsx) et l'inférence distribuée multi-nœuds via LMDeploy ou VLLM pour les modèles à grande échelle ou de réflexion. Les résultats d'évaluation sont publiés sur les classements OpenVLM et les espaces Hugging Face, avec des résultats détaillés téléchargeables. Le projet est associé à un article ACM Multimedia 2024 et à une communauté Discord.