这个项目能做什么

vLLM 是一个专注于高吞吐量和高效内存管理的 LLM 推理与部署库。它利用 PagedAttention 来管理 attention 的键值内存,并支持 continuous batching、chunked prefill 和 prefix caching。 关键技术能力包括: - 性能优化:支持多种量化方法 (FP8, INT8, INT4, AWQ, GGUF 等)、优化的 attention 内核 (FlashAttention, FlashInfer) 以及 speculative decoding。 - 灵活性:与 Hugging Face 模型集成,支持流式输出、结构化输出生成以及兼容 OpenAI 的 API 服务器。 - 分布式推理:支持 tensor, pipeline, data, expert 和 context 并行。 - 硬件兼容性:适用于 NVIDIA, AMD 和 Intel GPU,以及 x86/ARM/PowerPC CPU,并支持 Google TPUs 和华为 Ascend 等多种硬件插件。 - 模型支持:兼容 200 多种架构,包括 decoder-only LLMs、混合专家模型 (MoE)、多模态模型以及 embedding/retrieval 模型。