这个项目能做什么

LocalAI是一个自托管的开源AI推理引擎,旨在无需GPU的情况下在本地运行广泛的模型。它呈现为一个轻量级的核心而非单体包:每个后端都封装了一个上游引擎(如llama.cpp、vLLM、whisper.cpp、stable-diffusion或MLX),以独立的容器镜像形式提供,仅在需要模型时才会拉取。这意味着用户只需安装所选模型所需的组件。 README中描述的关键特性: - 可组合架构:后端相互独立,按需获取。 - 开放且可扩展:用户可以使用任何语言通过开放接口加载任意模型或构建自定义后端。 - 无缝API兼容:后端统一支持OpenAI、Anthropic和ElevenLabs API。 - 多模态能力:文本生成、文本转音频、音频转文本、图像生成、视觉、目标检测、重排序和嵌入向量均通过同一API提供。 - 硬件支持:NVIDIA(CUDA 12/13)、AMD(ROCm)、Intel(oneAPI/SYCL)、Apple Silicon(Metal)、Vulkan、NVIDIA Jetson(L4T)以及纯CPU。 - 多用户功能:API密钥认证、用户配额和基于角色的访问控制。 - 内置Agent:支持工具调用、RAG、MCP和技能调用的自主Agent,以及Agent Hub。 - 隐私优先定位:数据始终保留在用户的基础设施中。 安装选项包括macOS DMG(未签名,需移除隔离属性)以及适用于Docker或podman的容器镜像,提供CPU、NVIDIA CUDA 12/13、Jetson ARM64、AMD ROCm、Intel oneAPI和Vulkan等变体。模型可从模型库、Hugging Face、Ollama OCI注册表、YAML配置或标准OCI注册表加载。终端Agent支持与运行中的服务器交互,支持/models和/model等命令。 该项目声称支持60多个后端,并维护多个原生C/C++/GGML引擎,包括vllm.cpp、parakeet.cpp、moss-transcribe.cpp、moss-tts.cpp、magpie-tts.cpp、ced.cpp、voice-detect.cpp、voxtral-tts.c、vibevoice.cpp、rf-detr.cpp、locate-anything.cpp、depth-anything.cpp、face-detect.cpp、free-splatter.cpp、trellis2.cpp、privacy-filter.cpp、LocalVQE和本地向量存储。此外还维护了apex-quant,这是一种针对混合专家(MoE)模型的量化方案。 其他列出的功能包括约束语法、P2P推理、基于PostgreSQL和NATS的分布式模式、语音活动检测(Silero-VAD)、集成WebUI、微调与量化工作流、WebRTC支持以及用于语音到语音的实时API。该项目采用MIT许可证,由Ettore Di Giacinto创建,由一个小团队维护并接受社区贡献。