À propos du projet

vLLM est une bibliothèque pour l'inférence et le service de LLM qui se concentre sur un débit élevé et une gestion efficace de la mémoire. Elle utilise PagedAttention pour gérer la mémoire des clés et des valeurs d'attention et prend en charge le continuous batching, le chunked prefill et le prefix caching. Les capacités techniques clés incluent : - Optimisations de performance : Prise en charge de diverses méthodes de quantification (FP8, INT8, INT4, AWQ, GGUF, etc.), noyaux d'attention optimisés (FlashAttention, FlashInfer) et speculative decoding. - Flexibilité : Intégration avec les modèles Hugging Face, prise en charge des sorties en streaming, génération de sorties structurées et un serveur API compatible OpenAI. - Inférence distribuée : Prise en charge du parallélisme de tenseur, de pipeline, de données, d'experts et de contexte. - Compatibilité matérielle : Fonctionne avec les GPU NVIDIA, AMD et Intel, ainsi que les CPU x86/ARM/PowerPC, et divers plugins matériels comme les TPU Google et Huawei Ascend. - Support des modèles : Compatible avec plus de 200 architectures, y compris les LLM decoder-only, Mixture-of-Experts (MoE), les modèles multi-modaux et les modèles d'embedding/retrieval.