প্রকল্প সম্পর্কে
vLLM হলো LLM ইনফারেন্স এবং সার্ভিংয়ের জন্য একটি লাইব্রেরি যা উচ্চ থ্রুপুট এবং দক্ষ মেমরি ম্যানেজমেন্টের ওপর গুরুত্ব দেয়। এটি attention key এবং value মেমরি পরিচালনা করতে PagedAttention ব্যবহার করে এবং continuous batching, chunked prefill এবং prefix caching সমর্থন করে।
এর প্রধান প্রযুক্তিগত সক্ষমতাগুলোর মধ্যে রয়েছে:
- পারফরম্যান্স অপ্টিমাইজেশন: বিভিন্ন quantization পদ্ধতি (FP8, INT8, INT4, AWQ, GGUF ইত্যাদি), অপ্টিমাইজড attention kernels (FlashAttention, FlashInfer) এবং speculative decoding-এর সমর্থন।
- নমনীয়তা: Hugging Face মডেলের সাথে ইন্টিগ্রেশন, streaming outputs-এর সমর্থন, structured output জেনারেশন এবং একটি OpenAI-compatible API সার্ভার।
- ডিস্ট্রিবিউটেড ইনফারেন্স: tensor, pipeline, data, expert এবং context parallelism-এর সমর্থন।
- হার্ডওয়্যার সামঞ্জস্যতা: NVIDIA, AMD এবং Intel GPU-এর পাশাপাশি x86/ARM/PowerPC CPU এবং Google TPU ও Huawei Ascend-এর মতো বিভিন্ন হার্ডওয়্যার প্লাগইন-এর সাথে কাজ করে।
- মডেল সমর্থন: decoder-only LLM, Mixture-of-Experts (MoE), multi-modal মডেল এবং embedding/retrieval মডেলসহ ২০০টিরও বেশি আর্কিটেকচারের সাথে সামঞ্জস্যপূর্ণ।