프로젝트 소개

vLLM은 높은 처리량과 효율적인 메모리 관리에 중점을 둔 LLM 추론 및 서빙 라이브러리입니다. PagedAttention을 사용하여 어텐션 키 및 값 메모리를 관리하며, continuous batching, chunked prefill 및 prefix caching을 지원합니다. 주요 기술 역량은 다음과 같습니다: - 성능 최적화: 다양한 양자화 방법(FP8, INT8, INT4, AWQ, GGUF 등) 지원, 최적화된 어텐션 커널(FlashAttention, FlashInfer) 및 speculative decoding 지원. - 유연성: Hugging Face 모델과의 통합, 스트리밍 출력 지원, 구조화된 출력 생성 및 OpenAI 호환 API 서버 제공. - 분산 추론: tensor, pipeline, data, expert 및 context parallelism 지원. - 하드웨어 호환성: NVIDIA, AMD, Intel GPU뿐만 아니라 x86/ARM/PowerPC CPU, 그리고 Google TPU 및 Huawei Ascend와 같은 다양한 하드웨어 플러그인에서 작동. - 모델 지원: decoder-only LLM, Mixture-of-Experts (MoE), 멀티모달 모델, 임베딩/리트리벌 모델을 포함한 200개 이상의 아키텍처와 호환.