Об этом проекте

llama.cpp предоставляет чистую реализацию на C/C++ для инференса больших языковых моделей (LLM) и визуальных языковых моделей (VLM) без внешних зависимостей. Она построена на библиотеке ggml и поддерживает широкий спектр аппаратных архитектур, включая Apple Silicon (через Metal, ARM NEON и Accelerate), x86 (AVX, AVX2, AVX512, AMX) и RISC-V. Ключевые возможности включают: - Квантование: поддержка целочисленного квантования от 1,5 до 8 бит для снижения использования памяти и увеличения скорости инференса. - Аппаратное ускорение: специализированные ядра CUDA для GPU NVIDIA, а также поддержка AMD (HIP), Moore Threads (MUSA), Vulkan, SYCL и OpenCL. - Гибридный инференс: возможность использования гибридного инференса CPU+GPU для моделей, размер которых превышает доступный объем VRAM. - Инструменты: включает интерфейс командной строки (cli), инструмент завершения текста и совместимый с OpenAI REST API сервер со встроенным веб-интерфейсом. - Широкая поддержка бэкендов: совместимость с BLAS, BLIS, CANN, Metal, WebGPU и различными другими аппаратными бэкендами.