프로젝트 소개
llama.cpp는 외부 의존성 없이 대규모 언어 모델(LLM) 및 비전 언어 모델(VLM) 추론을 위한 순수 C/C++ 구현을 제공합니다. 이는 ggml 라이브러리를 기반으로 구축되었으며, Apple Silicon(Metal, ARM NEON, Accelerate), x86(AVX, AVX2, AVX512, AMX) 및 RISC-V를 포함한 광범위한 하드웨어 아키텍처를 지원합니다.
주요 기능은 다음과 같습니다:
- 양자화: 메모리 사용량을 줄이고 추론 속도를 높이기 위해 1.5비트에서 8비트 정수 양자화를 지원합니다.
- 하드웨어 가속: NVIDIA GPU를 위한 맞춤형 CUDA 커널뿐만 아니라 AMD(HIP), Moore Threads(MUSA), Vulkan, SYCL 및 OpenCL을 지원합니다.
- 하이브리드 추론: 사용 가능한 VRAM을 초과하는 모델에 대해 CPU+GPU 하이브리드 추론을 사용할 수 있는 기능이 있습니다.
- 도구: 명령줄 인터페이스(cli), 완성 도구 및 웹 UI가 내장된 OpenAI 호환 REST API 서버가 포함되어 있습니다.
- 광범위한 백엔드 지원: BLAS, BLIS, CANN, Metal, WebGPU 및 기타 다양한 하드웨어 전용 백엔드와 호환됩니다.