इस प्रोजेक्ट के बारे में
vLLM LLM इन्फरेंस और सर्विंग के लिए एक लाइब्रेरी है जो उच्च थ्रूपुट और कुशल मेमोरी प्रबंधन पर केंद्रित है। यह अटेंशन की (key) और वैल्यू (value) मेमोरी को प्रबंधित करने के लिए PagedAttention का उपयोग करता है और continuous batching, chunked prefill और prefix caching का समर्थन करता है।
मुख्य तकनीकी क्षमताओं में शामिल हैं:
- प्रदर्शन अनुकूलन (Performance Optimizations): विभिन्न क्वांटाइजेशन विधियों (FP8, INT8, INT4, AWQ, GGUF, आदि), अनुकूलित अटेंशन कर्नेल (FlashAttention, FlashInfer) और speculative decoding का समर्थन।
- लचीलापन (Flexibility): Hugging Face मॉडल के साथ एकीकरण, स्ट्रीमिंग आउटपुट, स्ट्रक्चर्ड आउटपुट जनरेशन और एक OpenAI-संगत API सर्वर का समर्थन।
- वितरित इन्फरेंस (Distributed Inference): tensor, pipeline, data, expert और context parallelism का समर्थन।
- हार्डवेयर अनुकूलता (Hardware Compatibility): NVIDIA, AMD और Intel GPUs के साथ-साथ x86/ARM/PowerPC CPUs और Google TPUs और Huawei Ascend जैसे विभिन्न हार्डवेयर प्लगइन्स के साथ काम करता है।
- मॉडल समर्थन (Model Support): 200 से अधिक आर्किटेक्चर के साथ संगत, जिसमें decoder-only LLMs, Mixture-of-Experts (MoE), मल्टी-मोडल मॉडल और एम्बेडिंग/रिट्रीवल मॉडल शामिल हैं।