このプロジェクトについて

SGLangは、単一のGPUから大規模な分散クラスターまでのデプロイをサポートする、大規模言語モデルおよびマルチモーダルモデル向けのサービングインフラストラクチャです。 主な技術的機能は以下の通りです: - 高速ランタイム:プレフィックスキャッシュのためのRadixAttention、オーバーヘッドゼロのCPUスケジューラ、prefill-decode分離、投機的デコーディング、連続バッチング、paged attention、および様々な並列化戦略(テンソル、パイプライン、エキスパート、データ)を搭載しています。 - 量子化と最適化:FP4、FP8、INT4、AWQ、GPTQ量子化に加え、構造化出力やマルチLoRAバッチングをサポートしています。 - 幅広いモデルサポート:Llama、Qwen、DeepSeek、Kimi、GLM、GPT、Gemma、Mistralに加え、埋め込みモデル、報酬モデル、拡散モデル(WAN、Qwen-Imageなど)と互換性があります。また、OpenAI APIおよびほとんどのHugging Faceモデルと互換性があります。 - ハードウェア互換性:NVIDIA GPU、AMD GPU、Intel Xeon CPU、Google TPU、Ascend NPUで動作します。 - RL統合:AReaL、Miles、slime、Tunix、verlなどのポストトレーニングフレームワークのロールアウトバックエンドとして機能します。