Sobre o projeto
vLLM é uma biblioteca para inferência e serviço de LLM que foca em alta taxa de transferência e gerenciamento eficiente de memória. Ela utiliza PagedAttention para gerenciar a memória de chave e valor de atenção e suporta continuous batching, chunked prefill e prefix caching.
As principais capacidades técnicas incluem:
- Otimizações de Desempenho: Suporte para vários métodos de quantização (FP8, INT8, INT4, AWQ, GGUF, etc.), kernels de atenção otimizados (FlashAttention, FlashInfer) e speculative decoding.
- Flexibilidade: Integração com modelos do Hugging Face, suporte para saídas de streaming, geração de saída estruturada e um servidor de API compatível com OpenAI.
- Inferência Distribuída: Suporte para paralelismo de tensor, pipeline, dados, expert e contexto.
- Compatibilidade de Hardware: Funciona com GPUs NVIDIA, AMD e Intel, bem como CPUs x86/ARM/PowerPC, e vários plugins de hardware como Google TPUs e Huawei Ascend.
- Suporte a Modelos: Compatível com mais de 200 arquiteturas, incluindo LLMs decoder-only, Mixture-of-Experts (MoE), modelos multi-modais e modelos de embedding/retrieval.