Sobre el proyecto

vLLM es una biblioteca para la inferencia y el servicio de LLM que se centra en el alto rendimiento y la gestión eficiente de la memoria. Utiliza PagedAttention para gestionar la memoria de claves y valores de atención, y admite continuous batching, chunked prefill y prefix caching. Las capacidades técnicas clave incluyen: - Optimizaciones de rendimiento: Soporte para varios métodos de cuantización (FP8, INT8, INT4, AWQ, GGUF, etc.), kernels de atención optimizados (FlashAttention, FlashInfer) y speculative decoding. - Flexibilidad: Integración con modelos de Hugging Face, soporte para salidas de streaming, generación de salidas estructuradas y un servidor de API compatible con OpenAI. - Inferencia distribuida: Soporte para paralelismo de tensor, pipeline, datos, experto y contexto. - Compatibilidad de hardware: Funciona con GPUs de NVIDIA, AMD e Intel, así como con CPUs x86/ARM/PowerPC, y varios complementos de hardware como Google TPUs y Huawei Ascend. - Soporte de modelos: Compatible con más de 200 arquitecturas, incluyendo LLMs decoder-only, Mixture-of-Experts (MoE), modelos multi-modales y modelos de embedding/recuperación.