这个项目能做什么

vLLM Ascend(vllm-ascend)是一个社区维护的硬件插件,使 vLLM 能够无缝运行在华为 Ascend NPU 上。它是 vLLM 社区中支持 Ascend 后端的推荐方法,遵循硬件可插拔 RFC,将 Ascend NPU 集成与 vLLM 核心解耦。 支持的硬件包括 Atlas 800I A2 推理系列、Atlas A2 训练系列、Atlas 800I A3 推理系列、Atlas A3 训练系列,以及 Atlas 300I Duo(实验性)。该插件运行在 Linux 上,使用 Python 3.9–3.11、CANN 8.2.rc1+、PyTorch 2.7.1+、torch-npu,并与匹配的 vLLM 版本兼容。 通过使用该插件,流行的开源模型——包括 Transformer 样架构、混合专家(MoE)、嵌入和多模态 LLM——可以运行在 Ascend NPU 硬件上。该项目提供与 vLLM 版本对齐的主分支和开发分支,并进行 CI 质量监控。最新稳定版本是 v0.7.3.post1,同时提供候选版本 v0.10.0rc1 和 v0.9.1rc2。 该项目采用 Apache 2.0 许可证,每周召开社区会议,并欢迎通过问题和开发者论坛进行贡献。用户故事展示了与 LLaMA-Factory、verl、TRL 和 GPUStack 等工具的集成,涵盖微调、评估、强化学习和部署场景。