프로젝트 소개

vLLM Ascend(vllm-ascend)는 vLLM이 Huawei Ascend NPU에서 원활하게 실행되도록 하는 커뮤니티 유지보수 하드웨어 플러그인입니다. 이는 Ascend 백엔드를 지원하기 위한 vLLM 커뮤니티의 권장 접근 방식으로, 하드웨어 플러그인 RFC를 준수하여 Ascend NPU 통합을 vLLM 코어에서 분리합니다. 지원되는 하드웨어에는 Atlas 800I A2 Inference 시리즈, Atlas A2 Training 시리즈, Atlas 800I A3 Inference 시리즈, Atlas A3 Training 시리즈, 그리고 Atlas 300I Duo(실험적)가 포함됩니다. 플러그인은 Python 3.9–3.11, CANN 8.2.rc1+, PyTorch 2.7.1+, torch-npu, 그리고 일치하는 vLLM 버전을 사용하여 Linux에서 실행됩니다. 이 플러그인을 사용하면 Transformer 유사 아키텍처, Mixture-of-Expert(MoE), 임베딩, 멀티모달 LLM을 포함한 인기 있는 오픈소스 모델을 Ascend NPU 하드웨어에서 실행할 수 있습니다. 프로젝트는 vLLM 릴리스와 일치하는 메인 및 개발 브랜치를 제공하며, CI 품질 모니터링을 수행합니다. 최신 안정 릴리스는 v0.7.3.post1이며, 릴리스 후보 v0.10.0rc1과 v0.9.1rc2도 사용 가능합니다. 프로젝트는 Apache 2.0 라이선스로 제공되며, 주간 커뮤니티 회의를 개최하고, 이슈 및 개발자 포럼을 통해 기여를 환영합니다. 사용자 사례는 LLaMA-Factory, verl, TRL, GPUStack과 같은 도구와의 통합을 보여주며, 미세 조정, 평가, 강화 학습, 배포 시나리오를 다룹니다.