프로젝트 소개

LocalAI는 GPU 없이 로컬에서 다양한 모델을 실행하도록 설계된 자체 호스팅 오픈소스 AI 추론 엔진입니다. 이는 모놀리식 번들보다는 작은 코어로 제공됩니다. 각 백엔드는 업스트림 엔진(예: llama.cpp, vLLM, whisper.cpp, stable-diffusion 또는 MLX)을 자체 컨테이너 이미지로 래핑하며, 모델이 필요할 때만 가져옵니다. 이는 사용자가 선택한 모델에 필요한 구성 요소만 설치한다는 의미입니다. README에 설명된 주요 특징: - 구성 가능한 아키텍처: 백엔드는 분리되어 있으며 필요할 때 가져옵니다. - 개방적이고 확장 가능: 사용자는 개방형 인터페이스를 통해 모든 모델을 로드하거나 모든 언어로 사용자 지정 백엔드를 구축할 수 있습니다. - 드롭인 API 호환성: OpenAI, Anthropic 및 ElevenLabs API는 모든 백엔드에서 지원됩니다. - 다중 모달리티: 텍스트 생성, 텍스트-오디오, 오디오-텍스트, 이미지 생성, 비전, 객체 감지, 재순위 지정 및 임베딩을 하나의 API 뒤에서 제공합니다. - 하드웨어 지원: NVIDIA (CUDA 12/13), AMD (ROCm), Intel (oneAPI/SYCL), Apple Silicon (Metal), Vulkan, NVIDIA Jetson (L4T) 및 CPU 전용. - 다중 사용자 기능: API 키 인증, 사용자 할당량 및 역할 기반 액세스. - 내장 에이전트: 도구 사용, RAG, MCP 및 스킬을 갖춘 자율 에이전트와 에이전트 허브. - 프라이버시 우선 포지셔닝: 데이터는 사용자 인프라에 유지됩니다. 설치 옵션에는 macOS DMG(서명되지 않아 격리 속성 제거 필요)와 Docker 또는 podman용 컨테이너 이미지가 포함되며, CPU, NVIDIA CUDA 12/13, Jetson ARM64, AMD ROCm, Intel oneAPI 및 Vulkan용 변형이 있습니다. 모델은 모델 갤러리, Hugging Face, Ollama OCI 레지스트리, YAML 구성 또는 표준 OCI 레지스트리에서 로드할 수 있습니다. 실행 중인 서버와 상호 작용하기 위한 터미널 에이전트가 제공되며, /models 및 /model과 같은 명령을 지원합니다. 이 프로젝트는 60개 이상의 지원되는 백엔드를 보고하며, vllm.cpp, parakeet.cpp, moss-transcribe.cpp, moss-tts.cpp, magpie-tts.cpp, ced.cpp, voice-detect.cpp, voxtral-tts.c, vibevoice.cpp, rf-detr.cpp, locate-anything.cpp, depth-anything.cpp, face-detect.cpp, free-splatter.cpp, trellis2.cpp, privacy-filter.cpp, LocalVQE 및 로컬 벡터 스토어를 포함한 여러 네이티브 C/C++/GGML 엔진을 유지 관리합니다. 또한 Mixture-of-Experts 모델을 위한 양자화 레시피인 apex-quant도 유지 관리합니다. 나열된 추가 기능으로는 제한된 문법, P2P 추론, PostgreSQL 및 NATS를 사용한 분산 모드, 음성 활동 감지(Silero-VAD), 통합 WebUI, 미세 조정 및 양자화 워크플로, WebRTC 지원, 음성-음성 실시간 API가 있습니다. 이 프로젝트는 MIT 라이선스이며, Ettore Di Giacinto가 만들었고 커뮤니티 기여를 통해 소규모 팀이 유지 관리합니다.