Об этом проекте

vLLM Ascend (vllm-ascend) — это плагин, поддерживаемый сообществом, который позволяет запускать vLLM на NPU Huawei Ascend. Он является рекомендованным способом интеграции Ascend в vLLM, следуя RFC о подключаемых модулях для разделения аппаратной поддержки от ядра vLLM. Поддерживаемое оборудование включает серии Atlas 800I A2 Inference, Atlas A2 Training, Atlas 800I A3 Inference, Atlas A3 Training и Atlas 300I Duo (экспериментально). Плагин работает на Linux с Python 3.9–3.11, CANN 8.2.rc1+, PyTorch 2.7.1+, torch-npu и соответствующей версией vLLM. С помощью этого плагина можно запускать популярные модели с открытым исходным кодом — включая архитектуры Transformer, Mixture-of-Expert (MoE), embedding и мультимодальные LLM — на NPU Ascend. Проект предоставляет стабильные и разрабатываемые ветки, соответствующие релизам vLLM, с мониторингом качества CI. Последний стабильный релиз — v0.7.3.post1, также доступны кандидаты в релизы v0.10.0rc1 и v0.9.1rc2. Проект лицензирован под Apache 2.0, проводит еженедельные встречи сообщества и приветствует вклад через issues и форум разработчиков. Истории пользователей демонстрируют интеграцию с LLaMA-Factory, verl, TRL и GPUStack для тонкой настройки, оценки, обучения с подкреплением и развертывания.