このプロジェクトについて
SGLangは、単一のGPUから大規模な分散クラスターまでのデプロイをサポートする、大規模言語モデルおよびマルチモーダルモデル向けのサービングインフラストラクチャです。
主な技術的機能は以下の通りです:
- 高速ランタイム:プレフィックスキャッシュのためのRadixAttention、オーバーヘッドゼロのCPUスケジューラ、prefill-decode分離、投機的デコーディング、連続バッチング、paged attention、および様々な並列化戦略(テンソル、パイプライン、エキスパート、データ)を搭載しています。
- 量子化と最適化:FP4、FP8、INT4、AWQ、GPTQ量子化に加え、構造化出力やマルチLoRAバッチングをサポートしています。
- 幅広いモデルサポート:Llama、Qwen、DeepSeek、Kimi、GLM、GPT、Gemma、Mistralに加え、埋め込みモデル、報酬モデル、拡散モデル(WAN、Qwen-Imageなど)と互換性があります。また、OpenAI APIおよびほとんどのHugging Faceモデルと互換性があります。
- ハードウェア互換性:NVIDIA GPU、AMD GPU、Intel Xeon CPU、Google TPU、Ascend NPUで動作します。
- RL統合:AReaL、Miles、slime、Tunix、verlなどのポストトレーニングフレームワークのロールアウトバックエンドとして機能します。