Об этом проекте

VLMEvalKit (имя Python-пакета vlmeval) — это открытый инструментарий оценки для больших визуально-языковых моделей (LVLM). Его заявленная цель — позволить исследователям и разработчикам запускать оценку LVLM одной командой на множестве бенчмарков без отдельной подготовки данных для каждого репозитория. В README сообщается о поддержке 220+ LMM и 80+ бенчмарков, охватывающих коммерческие API и открытые модели. Подход к оценке: инструментарий использует оценку на основе генерации для всех LVLM и предоставляет результаты как точного сопоставления, так и извлечения ответов с помощью LLM. В README отмечается, что он не предназначен для воспроизведения точных значений accuracy из оригинальных статей сторонних бенчмарков, поскольку некоторые бенчмарки используют другие парадигмы (например, оценку на основе PPL) и поскольку по умолчанию используется единый шаблон промпта для всех моделей, если только не реализован шаблон, специфичный для модели. Поддерживаемое содержимое: в README перечислены бенчмарки изображений и видео (70+ согласно таблице возможностей) и поддерживаемые LMM (200+), включая Qwen, InternVL, LLaVA, MiniCPM, Ovis, Gemini, Kimi-VL, LLaMA4, Phi, Grok и другие. Среди недавних добавлений упомянуты Video-MME-v2, SeePhys, PhyX, InternVL3, Qwen2.5-VL, MMMU-Pro, CC-OCR и многие другие. Быстрый старт: короткая демонстрация на Python показывает импорт supported_VLM из vlmeval.config, создание экземпляра модели, например idefics_9b_instruct, и вызов generate с путями к изображениям и вопросом. В README также есть ссылки на руководства Quickstart и Development на английском и китайском языках. Модель разработки: чтобы добавить модель, разработчик реализует одну функцию generate_inner(); загрузка данных, предобработка, вывод предсказаний и вычисление метрик выполняются кодовой базой. Вклад моделей, бенчмарков или крупных функций признаётся, а участники с тремя или более крупными вкладами могут войти в список авторов технического отчёта. Эксплуатационные замечания: в README рекомендуются конкретные версии transformers для разных семейств моделей, а также указания по torchvision и flash-attn. В нём описаны переменные окружения для моделей в режиме размышления (SPLIT_THINK), длинных ответов (PRED_FORMAT=tsv, чтобы избежать усечения ячеек xlsx) и многоузлового распределённого вывода через LMDeploy или VLLM для крупномасштабных моделей или моделей с размышлением. Результаты оценки публикуются на лидербордах OpenVLM и в пространствах Hugging Face, а подробные результаты можно скачать. Проект связан со статьёй ACM Multimedia 2024 и сообществом Discord.