À propos du projet

llama.cpp fournit une implémentation simple en C/C++ pour l'inférence de Large Language Model (LLM) et de Vision Language Model (VLM) sans dépendances externes. Il est basé sur la bibliothèque ggml et prend en charge un large éventail d'architectures matérielles, notamment Apple Silicon (via Metal, ARM NEON et Accelerate), x86 (AVX, AVX2, AVX512, AMX) et RISC-V. Les capacités clés incluent : - Quantification : Prise en charge de la quantification entière de 1,5 bit à 8 bits pour réduire l'utilisation de la mémoire et augmenter la vitesse d'inférence. - Accélération matérielle : Noyaux CUDA personnalisés pour les GPU NVIDIA, ainsi qu'un support pour AMD (HIP), Moore Threads (MUSA), Vulkan, SYCL et OpenCL. - Inférence hybride : Capacité d'utiliser l'inférence hybride CPU+GPU pour les modèles qui dépassent la VRAM disponible. - Outils : Comprend une interface en ligne de commande (cli), un outil de complétion et un serveur API REST compatible OpenAI avec une interface utilisateur web intégrée. - Large support de backends : Compatible avec BLAS, BLIS, CANN, Metal, WebGPU et divers autres backends spécifiques au matériel.