इस प्रोजेक्ट के बारे में
llama.cpp बाहरी निर्भरताओं के बिना Large Language Model (LLM) और Vision Language Model (VLM) इन्फरेंस के लिए एक साधारण C/C++ कार्यान्वयन प्रदान करता है। यह ggml लाइब्रेरी पर आधारित है और Apple Silicon (Metal, ARM NEON, और Accelerate के माध्यम से), x86 (AVX, AVX2, AVX512, AMX), और RISC-V सहित हार्डवेयर आर्किटेक्चर की एक विस्तृत श्रृंखला का समर्थन करता है।
मुख्य क्षमताओं में शामिल हैं:
- Quantization: मेमोरी उपयोग को कम करने और इन्फरेंस गति बढ़ाने के लिए 1.5-बिट से 8-बिट इंटीजर quantization का समर्थन करता है।
- Hardware Acceleration: NVIDIA GPUs के लिए कस्टम CUDA kernels, साथ ही AMD (HIP), Moore Threads (MUSA), Vulkan, SYCL, और OpenCL के लिए समर्थन।
- Hybrid Inference: उन मॉडलों के लिए CPU+GPU हाइब्रिड इन्फरेंस का उपयोग करने की क्षमता जो उपलब्ध VRAM से अधिक हैं।
- Tools: इसमें एक कमांड-लाइन इंटरफेस (cli), एक completion टूल, और बिल्ट-इन वेब UI के साथ एक OpenAI-संगत REST API सर्वर शामिल है।
- Broad Backend Support: BLAS, BLIS, CANN, Metal, WebGPU, और विभिन्न अन्य हार्डवेयर-विशिष्ट बैकएंड के साथ संगत।