প্রকল্প সম্পর্কে

llama.cpp কোনো এক্সটারনাল ডিপেন্ডেন্সি ছাড়াই Large Language Model (LLM) এবং Vision Language Model (VLM) ইনফারেন্সের জন্য একটি প্লেইন C/C++ ইমপ্লিমেন্টেশন প্রদান করে। এটি ggml লাইব্রেরির উপর ভিত্তি করে তৈরি এবং Apple Silicon (Metal, ARM NEON এবং Accelerate-এর মাধ্যমে), x86 (AVX, AVX2, AVX512, AMX) এবং RISC-V সহ বিস্তৃত হার্ডওয়্যার আর্কিটেকচার সমর্থন করে। এর মূল সক্ষমতাগুলোর মধ্যে রয়েছে: - Quantization: মেমরি ব্যবহার কমাতে এবং ইনফারেন্স গতি বাড়াতে ১.৫-বিট থেকে ৮-বিট ইন্টিজার কোয়ান্টাইজেশন সমর্থন করে। - Hardware Acceleration: NVIDIA GPU-এর জন্য কাস্টম CUDA কার্নেল, সেইসাথে AMD (HIP), Moore Threads (MUSA), Vulkan, SYCL এবং OpenCL সমর্থন করে। - Hybrid Inference: যেসব মডেল উপলব্ধ VRAM-এর সীমা অতিক্রম করে, সেগুলোর জন্য CPU+GPU হাইব্রিড ইনফারেন্স ব্যবহারের ক্ষমতা। - Tools: এতে একটি কমান্ড-লাইন ইন্টারফেস (cli), একটি কমপ্লিশন টুল এবং বিল্ট-ইন ওয়েব UI সহ একটি OpenAI-কম্প্যাটিবল REST API সার্ভার অন্তর্ভুক্ত রয়েছে। - Broad Backend Support: BLAS, BLIS, CANN, Metal, WebGPU এবং অন্যান্য বিভিন্ন হার্ডওয়্যার-স্পেসিফিক ব্যাকএন্ডের সাথে সামঞ্জস্যপূর্ণ।