Sobre o projeto
O llama.cpp fornece uma implementação simples em C/C++ para inferência de Large Language Model (LLM) e Vision Language Model (VLM) sem dependências externas. É construído sobre a biblioteca ggml e suporta uma ampla gama de arquiteturas de hardware, incluindo Apple Silicon (via Metal, ARM NEON e Accelerate), x86 (AVX, AVX2, AVX512, AMX) e RISC-V.
As principais capacidades incluem:
- Quantização: Suporta quantização de inteiros de 1,5-bit a 8-bit para reduzir o uso de memória e aumentar a velocidade de inferência.
- Aceleração de Hardware: Kernels CUDA personalizados para GPUs NVIDIA, bem como suporte para AMD (HIP), Moore Threads (MUSA), Vulkan, SYCL e OpenCL.
- Inferência Híbrida: Capacidade de usar inferência híbrida CPU+GPU para modelos que excedem a VRAM disponível.
- Ferramentas: Inclui uma interface de linha de comando (cli), uma ferramenta de conclusão e um servidor de API REST compatível com OpenAI com uma interface web integrada.
- Amplo Suporte de Backend: Compatível com BLAS, BLIS, CANN, Metal, WebGPU e vários outros backends específicos de hardware.