Sobre el proyecto

vLLM Ascend (vllm-ascend) es un plugin de hardware mantenido por la comunidad que permite a vLLM ejecutarse sin problemas en NPUs de Huawei Ascend. Es el enfoque recomendado dentro de la comunidad de vLLM para admitir el backend de Ascend, siguiendo el RFC de Hardware Pluggable para desacoplar la integración de NPU de Ascend del núcleo de vLLM. El hardware admitido incluye las series de inferencia Atlas 800I A2, las series de entrenamiento Atlas A2, las series de inferencia Atlas 800I A3, las series de entrenamiento Atlas A3 y Atlas 300I Duo (experimental). El plugin se ejecuta en Linux con Python 3.9–3.11, CANN 8.2.rc1+, PyTorch 2.7.1+, torch-npu y una versión de vLLM coincidente. Al usar este plugin, los modelos de código abierto populares, incluidas las arquitecturas tipo Transformer, Mixture-of-Expert (MoE), embedding y LLM multimodales, pueden ejecutarse en hardware de NPU de Ascend. El proyecto proporciona ramas principales y de desarrollo alineadas con las versiones de vLLM, con monitoreo de calidad de CI. La última versión estable es v0.7.3.post1, con candidatos a versión v0.10.0rc1 y v0.9.1rc2 también disponibles. El proyecto tiene licencia Apache 2.0, celebra reuniones comunitarias semanales y recibe contribuciones a través de issues y el foro de desarrolladores. Las historias de usuarios demuestran la integración con herramientas como LLaMA-Factory, verl, TRL y GPUStack en escenarios de ajuste fino, evaluación, aprendizaje por refuerzo y despliegue.