このプロジェクトについて

vLLMは、高スループットと効率的なメモリ管理に焦点を当てたLLM推論およびサービング用のライブラリです。PagedAttentionを利用してアテンションのキーおよびバリューメモリを管理し、continuous batching、chunked prefill、およびprefix cachingをサポートしています。 主な技術的機能は以下の通りです: - パフォーマンス最適化:さまざまな量子化手法(FP8、INT8、INT4、AWQ、GGUFなど)、最適化されたアテンションカーネル(FlashAttention、FlashInfer)、および投機的デコード(speculative decoding)をサポート。 - 柔軟性:Hugging Faceモデルとの統合、ストリーミング出力のサポート、構造化出力の生成、およびOpenAI互換のAPIサーバーを提供。 - 分散推論:テンソル、パイプライン、データ、エキスパート、およびコンテキスト並列処理をサポート。 - ハードウェア互換性:NVIDIA、AMD、IntelのGPUに加え、x86/ARM/PowerPC CPU、およびGoogle TPUやHuawei Ascendなどの各種ハードウェアプラグインで動作。 - モデルサポート:decoder-only LLM、Mixture-of-Experts (MoE)、マルチモーダルモデル、埋め込み/検索モデルを含む200以上のアーキテクチャに対応。