Об этом проекте

LocalAI — это self-hosted, open-source ИИ-движок для инференса, предназначенный для запуска широкого спектра моделей локально без необходимости в GPU. Проект позиционируется как компактное ядро, а не монолитный набор: каждый бэкенд оборачивает upstream-движок (такой как llama.cpp, vLLM, whisper.cpp, stable-diffusion или MLX) в собственном контейнерном образе, который загружается только тогда, когда требуется модель. Это означает, что пользователи устанавливают только те компоненты, которые необходимы для выбранных моделей. Ключевые характеристики, описанные в README: - Композитная архитектура: бэкенды независимы и загружаются по требованию. - Открытость и расширяемость: пользователи могут загружать любые модели или создавать пользовательские бэкенды на любом языке программирования через open interface. - Совместимость API: поддержка API OpenAI, Anthropic и ElevenLabs через все бэкенды. - Мульти-модальность: генерация текста, text-to-audio, audio-to-text, генерация изображений, vision, обнаружение объектов, reranking и эмбеддинги за одним API. - Поддержка железа: NVIDIA (CUDA 12/13), AMD (ROCm), Intel (oneAPI/SYCL), Apple Silicon (Metal), Vulkan, NVIDIA Jetson (L4T) и только CPU. - Многопользовательские возможности: аутентификация по API-ключам, квоты пользователей и доступ на основе ролей. - Встроенные агенты: автономные агенты с использованием инструментов, RAG, MCP и скиллами, плюс Agent Hub. - Позиционирование privacy-first: данные остаются в инфраструктуре пользователя. Варианты установки включают macOS DMG (неподписанный, требует удаления quarantine-атрибута) и контейнерные образы для Docker или podman, с вариантами для CPU, NVIDIA CUDA 12/13, Jetson ARM64, AMD ROCm, Intel oneAPI и Vulkan. Модели можно загружать из model gallery, Hugging Face, Ollama OCI registry, YAML-конфигов или стандартных OCI-реестров. Доступен терминальный агент для взаимодействия с запущенным сервером, поддерживающий команды типа /models и /model. Проект заявляет о 60+ поддерживаемых бэкендах и поддерживает ряд нативных C/C++/GGML-движков, включая vllm.cpp, parakeet.cpp, moss-transcribe.cpp, moss-tts.cpp, magpie-tts.cpp, ced.cpp, voice-detect.cpp, voxtral-tts.c, vibevoice.cpp, rf-detr.cpp, locate-anything.cpp, depth-anything.cpp, face-detect.cpp, free-splatter.cpp, trellis2.cpp, privacy-filter.cpp, LocalVQE, а также локальное векторное хранилище. Поддерживается apex-quant — рецепт квантования для Mixture-of-Experts моделей. Дополнительные возможности включают constrained grammars, P2P-инференс, distributed mode с PostgreSQL и NATS, детектирование речевой активности (Silero-VAD), интегрированный WebUI, workflow fine-tuning и квантования, поддержку WebRTC и Realtime API для speech-to-speech. Проект лицензирован по MIT, создан Ettore Di Giacinto и поддерживается небольшой командой при участии сообщества.