Об этом проекте
vLLM — это библиотека для инференса и развертывания LLM, ориентированная на высокую пропускную способность и эффективное управление памятью. Она использует PagedAttention для управления памятью ключей и значений внимания, а также поддерживает continuous batching, chunked prefill и prefix caching.
Ключевые технические возможности включают:
- Оптимизация производительности: поддержка различных методов квантования (FP8, INT8, INT4, AWQ, GGUF и др.), оптимизированные ядра внимания (FlashAttention, FlashInfer) и спекулятивное декодирование.
- Гибкость: интеграция с моделями Hugging Face, поддержка потокового вывода, генерация структурированного вывода и API-сервер, совместимый с OpenAI.
- Распределенный инференс: поддержка тензорного, конвейерного, дата-параллелизма, а также параллелизма экспертов и контекста.
- Совместимость с оборудованием: работа с GPU NVIDIA, AMD и Intel, процессорами x86/ARM/PowerPC, а также различными аппаратными плагинами, такими как Google TPU и Huawei Ascend.
- Поддержка моделей: совместимость с более чем 200 архитектурами, включая decoder-only LLM, Mixture-of-Experts (MoE), мультимодальные модели, а также модели эмбеддингов и поиска.