这个项目能做什么

SGLang 是一个用于大语言模型和多模态模型的服务基础设施,支持从单 GPU 到大规模分布式集群的部署。 核心技术能力包括: - 快速运行时:具备用于前缀缓存的 RadixAttention、零开销 CPU 调度器、预填充-解码解耦 (prefill-decode disaggregation)、投机采样 (speculative decoding)、连续批处理 (continuous batching)、PagedAttention 以及多种并行策略(张量、流水线、专家和数据并行)。 - 量化与优化:支持 FP4、FP8、INT4、AWQ 和 GPTQ 量化,以及结构化输出和多 LoRA 批处理。 - 广泛的模型支持:兼容 Llama、Qwen、DeepSeek、Kimi、GLM、GPT、Gemma 和 Mistral,以及嵌入模型、奖励模型和扩散模型(如 WAN、Qwen-Image)。它兼容 OpenAI API 和大多数 Hugging Face 模型。 - 硬件兼容性:可在 NVIDIA GPU、AMD GPU、Intel Xeon CPU、Google TPU 和 Ascend NPU 上运行。 - RL 集成:可作为 AReaL、Miles、slime、Tunix 和 verl 等后训练框架的 rollout 后端。