Sobre o projeto
vLLM Ascend (vllm-ascend) é um plugin de hardware mantido pela comunidade que permite ao vLLM rodar perfeitamente em NPUs Huawei Ascend. É a abordagem recomendada pela comunidade vLLM para suportar o backend Ascend, aderindo ao RFC de Hardware Pluggable para desacoplar a integração da NPU Ascend do núcleo do vLLM.
O hardware suportado inclui as séries de inferência Atlas 800I A2, as séries de treinamento Atlas A2, as séries de inferência Atlas 800I A3, as séries de treinamento Atlas A3 e o Atlas 300I Duo (experimental). O plugin roda no Linux com Python 3.9–3.11, CANN 8.2.rc1+, PyTorch 2.7.1+, torch-npu e uma versão correspondente do vLLM.
Ao usar este plugin, modelos de código aberto populares — incluindo arquiteturas semelhantes a Transformer, Mixture-of-Expert (MoE), embedding e LLMs multimodais — podem rodar no hardware da NPU Ascend. O projeto fornece branches principais e de desenvolvimento alinhados com os lançamentos do vLLM, com monitoramento de qualidade por CI. A última versão estável é a v0.7.3.post1, com candidatos a lançamento v0.10.0rc1 e v0.9.1rc2 também disponíveis.
O projeto é licenciado sob Apache 2.0, realiza reuniões comunitárias semanais e recebe contribuições via issues e fórum de desenvolvedores. Histórias de usuários demonstram integração com ferramentas como LLaMA-Factory, verl, TRL e GPUStack em cenários de fine-tuning, avaliação, aprendizado por reforço e implantação.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.