Об этом проекте
llama.cpp предоставляет чистую реализацию на C/C++ для инференса больших языковых моделей (LLM) и визуальных языковых моделей (VLM) без внешних зависимостей. Она построена на библиотеке ggml и поддерживает широкий спектр аппаратных архитектур, включая Apple Silicon (через Metal, ARM NEON и Accelerate), x86 (AVX, AVX2, AVX512, AMX) и RISC-V.
Ключевые возможности включают:
- Квантование: поддержка целочисленного квантования от 1,5 до 8 бит для снижения использования памяти и увеличения скорости инференса.
- Аппаратное ускорение: специализированные ядра CUDA для GPU NVIDIA, а также поддержка AMD (HIP), Moore Threads (MUSA), Vulkan, SYCL и OpenCL.
- Гибридный инференс: возможность использования гибридного инференса CPU+GPU для моделей, размер которых превышает доступный объем VRAM.
- Инструменты: включает интерфейс командной строки (cli), инструмент завершения текста и совместимый с OpenAI REST API сервер со встроенным веб-интерфейсом.
- Широкая поддержка бэкендов: совместимость с BLAS, BLIS, CANN, Metal, WebGPU и различными другими аппаратными бэкендами.