عن المشروع

vLLM هي مكتبة لاستنتاج ونشر نماذج LLM تركز على الإنتاجية العالية والإدارة الفعالة للذاكرة. وهي تستخدم PagedAttention لإدارة ذاكرة المفاتيح والقيم الخاصة بالانتباه، وتدعم الـ continuous batching، والـ chunked prefill، والـ prefix caching. تشمل القدرات التقنية الرئيسية ما يلي: - تحسينات الأداء: دعم طرق تكميم متنوعة (FP8, INT8, INT4, AWQ, GGUF، وغيرها)، ونوى انتباه محسنة (FlashAttention, FlashInfer)، والـ speculative decoding. - المرونة: التكامل مع نماذج Hugging Face، ودعم مخرجات البث (streaming outputs)، وتوليد المخرجات المهيكلة، وخادم API متوافق مع OpenAI. - الاستنتاج الموزع: دعم التوازي في التنسور (tensor)، والخطوط (pipeline)، والبيانات (data)، والخبراء (expert)، والسياق (context). - التوافق مع الأجهزة: تعمل مع وحدات معالجة الرسومات من NVIDIA وAMD وIntel، بالإضافة إلى معالجات x86/ARM/PowerPC، ومكونات إضافية للأجهزة مثل Google TPUs وHuawei Ascend. - دعم النماذج: متوافقة مع أكثر من 200 بنية، بما في ذلك نماذج LLM ذات فك التشفير فقط (decoder-only)، ونماذج خليط الخبراء (MoE)، والنماذج متعددة الوسائط، ونماذج التضمين والاسترجاع (embedding/retrieval).