Sobre o projeto
VLMEvalKit (nome do pacote Python vlmeval) é um kit de ferramentas de avaliação de código aberto para grandes modelos de visão-linguagem (LVLMs). Seu propósito declarado é permitir que pesquisadores e desenvolvedores executem avaliação com um único comando de LVLMs em muitos benchmarks sem preparar dados separadamente para cada repositório. O README relata suporte a mais de 220 LMMs e mais de 80 benchmarks, cobrindo APIs comerciais e modelos de código aberto.
Abordagem de avaliação: o kit de ferramentas usa avaliação baseada em geração para todos os LVLMs e fornece resultados tanto de correspondência exata quanto de extração de respostas baseada em LLM. O README observa que ele não se destina a reproduzir números exatos de acurácia dos artigos originais de benchmarks de terceiros, porque alguns benchmarks usam paradigmas diferentes (por exemplo, avaliação baseada em PPL) e porque um único template de prompt padrão é usado entre modelos, a menos que um template específico do modelo seja implementado.
Conteúdo suportado: o README lista benchmarks de imagem e vídeo (mais de 70 conforme a tabela de recursos) e LMMs suportados (mais de 200), incluindo Qwen, InternVL, LLaVA, MiniCPM, Ovis, Gemini, Kimi-VL, LLaMA4, Phi, Grok e outros. Adições recentes mencionadas incluem Video-MME-v2, SeePhys, PhyX, InternVL3, Qwen2.5-VL, MMMU-Pro, CC-OCR e muitos outros.
Início rápido: uma breve demonstração em Python mostra a importação de supported_VLM de vlmeval.config, a instanciação de um modelo como idefics_9b_instruct e a chamada de generate com caminhos de imagem mais uma pergunta. O README também aponta para os guias Quickstart e Development em inglês e chinês.
Modelo de desenvolvimento: para adicionar um modelo, um desenvolvedor implementa uma única função generate_inner(); download de dados, pré-processamento, inferência de predição e cálculo de métricas são tratados pela base de código. Contribuições de modelos, benchmarks ou recursos importantes são reconhecidas, e contribuidores com três ou mais contribuições importantes podem entrar na lista de autores do relatório técnico.
Notas operacionais: o README recomenda versões específicas de transformers para diferentes famílias de modelos, além de orientações sobre torchvision e flash-attn. Ele documenta variáveis de ambiente para modelos em modo de pensamento (SPLIT_THINK), respostas longas (PRED_FORMAT=tsv para evitar truncamento de células xlsx) e inferência distribuída em múltiplos nós via LMDeploy ou VLLM para modelos de grande escala ou de pensamento. Os resultados de avaliação são publicados nos leaderboards OpenVLM e nos spaces do Hugging Face, com resultados detalhados disponíveis para download. O projeto está associado a um artigo do ACM Multimedia 2024 e a uma comunidade no Discord.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.