منصوبے کے بارے میں
vLLM ایک لائبریری ہے جو LLM انفرنس اور سرونگ کے لیے ہے، جس کی توجہ ہائی تھروپٹ اور موثر میموری مینجمنٹ پر ہے۔ یہ attention key اور value میموری کو منظم کرنے کے لیے PagedAttention کا استعمال کرتی ہے اور continuous batching، chunked prefill، اور prefix caching کی حمایت کرتی ہے۔
اہم تکنیکی صلاحیتوں میں شامل ہیں:
- کارکردگی کی بہتری (Performance Optimizations): مختلف quantization طریقوں (FP8, INT8, INT4, AWQ, GGUF وغیرہ)، بہتر attention kernels (FlashAttention, FlashInfer)، اور speculative decoding کی سپورٹ۔
- لچک (Flexibility): Hugging Face ماڈلز کے ساتھ انٹیگریشن، streaming outputs کی سپورٹ، structured output generation، اور ایک OpenAI-compatible API سرور۔
- تقسیم شدہ انفرنس (Distributed Inference): tensor, pipeline, data, expert, اور context parallelism کی سپورٹ۔
- ہارڈویئر ہم آہنگی (Hardware Compatibility): NVIDIA, AMD, اور Intel GPUs کے ساتھ ساتھ x86/ARM/PowerPC CPUs، اور مختلف ہارڈویئر پلگ انز جیسے Google TPUs اور Huawei Ascend کے ساتھ کام کرتا ہے۔
- ماڈل سپورٹ: 200 سے زیادہ آرکیٹیکچرز کے ساتھ ہم آہنگ ہے، بشمول decoder-only LLMs, Mixture-of-Experts (MoE)، multi-modal ماڈلز، اور embedding/retrieval ماڈلز۔