منصوبے کے بارے میں

llama.cpp بیرونی dependencies کے بغیر Large Language Model (LLM) اور Vision Language Model (VLM) انفرنس کے لیے ایک سادہ C/C++ implementation فراہم کرتا ہے۔ یہ ggml لائبریری پر مبنی ہے اور ہارڈ ویئر آرکیٹیکچرز کی ایک وسیع رینج کو سپورٹ کرتا ہے، بشمول Apple Silicon (Metal, ARM NEON، اور Accelerate کے ذریعے)، x86 (AVX, AVX2, AVX512, AMX)، اور RISC-V۔ اہم صلاحیتوں میں شامل ہیں: - Quantization: میموری کے استعمال کو کم کرنے اور انفرنس کی رفتار بڑھانے کے لیے 1.5-bit سے 8-bit integer quantization کی سپورٹ۔ - Hardware Acceleration: NVIDIA GPUs کے لیے کسٹم CUDA kernels، cũng جیسے AMD (HIP)، Moore Threads (MUSA)، Vulkan، SYCL، اور OpenCL کی سپورٹ۔ - Hybrid Inference: ان ماڈلز کے لیے CPU+GPU hybrid inference استعمال کرنے کی صلاحیت جو دستیاب VRAM سے زیادہ ہیں۔ - Tools: اس میں ایک command-line interface (cli)، ایک completion tool، اور بلٹ ان web UI کے ساتھ OpenAI-compatible REST API server شامل ہے۔ - Broad Backend Support: BLAS, BLIS, CANN, Metal, WebGPU، اور مختلف دیگر ہارڈ ویئر مخصوص backends کے ساتھ ہم آہنگ۔