Об этом проекте

vLLM — это библиотека для инференса и развертывания LLM, ориентированная на высокую пропускную способность и эффективное управление памятью. Она использует PagedAttention для управления памятью ключей и значений внимания, а также поддерживает continuous batching, chunked prefill и prefix caching. Ключевые технические возможности включают: - Оптимизация производительности: поддержка различных методов квантования (FP8, INT8, INT4, AWQ, GGUF и др.), оптимизированные ядра внимания (FlashAttention, FlashInfer) и спекулятивное декодирование. - Гибкость: интеграция с моделями Hugging Face, поддержка потокового вывода, генерация структурированного вывода и API-сервер, совместимый с OpenAI. - Распределенный инференс: поддержка тензорного, конвейерного, дата-параллелизма, а также параллелизма экспертов и контекста. - Совместимость с оборудованием: работа с GPU NVIDIA, AMD и Intel, процессорами x86/ARM/PowerPC, а также различными аппаратными плагинами, такими как Google TPU и Huawei Ascend. - Поддержка моделей: совместимость с более чем 200 архитектурами, включая decoder-only LLM, Mixture-of-Experts (MoE), мультимодальные модели, а также модели эмбеддингов и поиска.