Sobre el proyecto

llama.cpp proporciona una implementación sencilla en C/C++ para la inferencia de Modelos de Lenguaje Extensos (LLM) y Modelos de Lenguaje de Visión (VLM) sin dependencias externas. Está construido sobre la biblioteca ggml y es compatible con una amplia gama de arquitecturas de hardware, incluyendo Apple Silicon (vía Metal, ARM NEON y Accelerate), x86 (AVX, AVX2, AVX512, AMX) y RISC-V. Las capacidades clave incluyen: - Cuantización: Soporta cuantización de enteros desde 1.5 bits hasta 8 bits para reducir el uso de memoria y aumentar la velocidad de inferencia. - Aceleración de Hardware: Kernels de CUDA personalizados para GPUs de NVIDIA, así como soporte para AMD (HIP), Moore Threads (MUSA), Vulkan, SYCL y OpenCL. - Inferencia Híbrida: Capacidad de utilizar inferencia híbrida CPU+GPU para modelos que superan la VRAM disponible. - Herramientas: Incluye una interfaz de línea de comandos (cli), una herramienta de completado y un servidor de API REST compatible con OpenAI con una interfaz web integrada. - Amplio Soporte de Backend: Compatible con BLAS, BLIS, CANN, Metal, WebGPU y varios otros backends específicos de hardware.