Sobre o projeto

O llama.cpp fornece uma implementação simples em C/C++ para inferência de Large Language Model (LLM) e Vision Language Model (VLM) sem dependências externas. É construído sobre a biblioteca ggml e suporta uma ampla gama de arquiteturas de hardware, incluindo Apple Silicon (via Metal, ARM NEON e Accelerate), x86 (AVX, AVX2, AVX512, AMX) e RISC-V. As principais capacidades incluem: - Quantização: Suporta quantização de inteiros de 1,5-bit a 8-bit para reduzir o uso de memória e aumentar a velocidade de inferência. - Aceleração de Hardware: Kernels CUDA personalizados para GPUs NVIDIA, bem como suporte para AMD (HIP), Moore Threads (MUSA), Vulkan, SYCL e OpenCL. - Inferência Híbrida: Capacidade de usar inferência híbrida CPU+GPU para modelos que excedem a VRAM disponível. - Ferramentas: Inclui uma interface de linha de comando (cli), uma ferramenta de conclusão e um servidor de API REST compatível com OpenAI com uma interface web integrada. - Amplo Suporte de Backend: Compatível com BLAS, BLIS, CANN, Metal, WebGPU e vários outros backends específicos de hardware.