Sobre el proyecto
vLLM es una biblioteca para la inferencia y el servicio de LLM que se centra en el alto rendimiento y la gestión eficiente de la memoria. Utiliza PagedAttention para gestionar la memoria de claves y valores de atención, y admite continuous batching, chunked prefill y prefix caching.
Las capacidades técnicas clave incluyen:
- Optimizaciones de rendimiento: Soporte para varios métodos de cuantización (FP8, INT8, INT4, AWQ, GGUF, etc.), kernels de atención optimizados (FlashAttention, FlashInfer) y speculative decoding.
- Flexibilidad: Integración con modelos de Hugging Face, soporte para salidas de streaming, generación de salidas estructuradas y un servidor de API compatible con OpenAI.
- Inferencia distribuida: Soporte para paralelismo de tensor, pipeline, datos, experto y contexto.
- Compatibilidad de hardware: Funciona con GPUs de NVIDIA, AMD e Intel, así como con CPUs x86/ARM/PowerPC, y varios complementos de hardware como Google TPUs y Huawei Ascend.
- Soporte de modelos: Compatible con más de 200 arquitecturas, incluyendo LLMs decoder-only, Mixture-of-Experts (MoE), modelos multi-modales y modelos de embedding/recuperación.