这个项目能做什么
llama.cpp 提供了一个纯 C/C++ 实现的大语言模型 (LLM) 和视觉语言模型 (VLM) 推理方案,无需外部依赖。它基于 ggml 库构建,支持广泛的硬件架构,包括 Apple Silicon (通过 Metal, ARM NEON 和 Accelerate)、x86 (AVX, AVX2, AVX512, AMX) 以及 RISC-V。
核心能力包括:
- 量化:支持 1.5 位至 8 位整数量化,以减少内存占用并提高推理速度。
- 硬件加速:为 NVIDIA GPU 提供自定义 CUDA 内核,并支持 AMD (HIP)、摩尔线程 (MUSA)、Vulkan、SYCL 和 OpenCL。
- 混合推理:对于超过可用 VRAM 的模型,能够使用 CPU+GPU 混合推理。
- 工具:包含命令行界面 (cli)、补全工具以及一个带有内置 Web UI 的 OpenAI 兼容 REST API 服务器。
- 广泛的后端支持:兼容 BLAS, BLIS, CANN, Metal, WebGPU 以及多种其他硬件特定后端。