프로젝트 소개

SGLang은 단일 GPU부터 대규모 분산 클러스터까지 다양한 배포를 지원하는 대규모 언어 및 멀티모달 모델용 서빙 인프라입니다. 주요 기술 역량은 다음과 같습니다: - 빠른 런타임: 프리픽스 캐싱을 위한 RadixAttention, 제로 오버헤드 CPU 스케줄러, prefill-decode 분리, 투기적 디코딩(speculative decoding), 연속 배칭(continuous batching), paged attention 및 다양한 병렬화 전략(tensor, pipeline, expert, data)을 특징으로 합니다. - 양자화 및 최적화: FP4, FP8, INT4, AWQ, GPTQ 양자화뿐만 아니라 구조화된 출력(structured outputs) 및 multi-LoRA 배칭을 지원합니다. - 광범위한 모델 지원: Llama, Qwen, DeepSeek, Kimi, GLM, GPT, Gemma, Mistral은 물론 임베딩, 리워드 및 확산 모델(예: WAN, Qwen-Image)과 호환됩니다. 또한 OpenAI API 및 대부분의 Hugging Face 모델과 호환됩니다. - 하드웨어 호환성: NVIDIA GPU, AMD GPU, Intel Xeon CPU, Google TPU 및 Ascend NPU에서 실행됩니다. - RL 통합: AReaL, Miles, slime, Tunix, verl을 포함한 사후 학습 프레임워크의 롤아웃 백엔드로 활용됩니다.