这个项目能做什么
ODS(Osmantic Deployment System)是一套自托管AI服务器栈,面向希望在自己的硬件上运行私有AI、而不想手动拼装十几个服务的人群。该仓库目前处于V3预发布状态:在正式V3发布前进行公开测试与完善,并提供了固定的源码快照(v3.0.0)以保证可复现性。README指出完整的集群资格认证尚未完成,并指向发布说明和晋级记录以了解已知限制和剩余关卡。
包含的内容
ODS安装并连接原本需要分别配置的组件。文档中列出的部分包括:
- 通过llama-server进行本地模型推理,并基于硬件选择模型。
- Open WebUI作为ChatGPT风格的浏览器聊天界面。
- 用于模型、服务、设置、GPU状态和扩展的控制仪表板,以及仪表板API。
- LiteLLM作为API网关,支持本地、云端和混合模式。
- 用于RAG和搜索工作流的TEI嵌入。
- 语音:Whisper用于语音转文本,Kokoro用于文本转语音。
- 智能体与自动化:Portal(在合格的macOS/Ubuntu/Debian systemd主机上捆绑的对话助手)、Hermes Agent、已弃用的OpenClaw智能体、n8n工作流自动化、APE(Agent Policy Engine)、OpenCode和Memory Shepherd。
- 知识与搜索:Qdrant向量数据库、SearXNG自托管搜索、Perplexica,以及可选的Brave Search API集成。
- 创意:ComfyUI用于基于节点的图像生成。
- 隐私与运维:Privacy Shield PII清洗代理、Token Spy使用监控,以及可选的Langfuse可观测性。
安装与平台
在Linux/macOS上通过托管脚本一条命令即可安装,在Windows上则通过一段PowerShell代码块下载源码ZIP并运行Windows安装程序。必须安装并运行Docker;Windows需要带有WSL2后端的Docker Desktop,以及非管理员权限的PowerShell会话。安装后,Web UI位于localhost:3000。各平台均提供了卸载命令。
根据README,支持的平台包括:Linux(NVIDIA和AMD Strix Halo)、Windows(NVIDIA和AMD),以及macOS Apple Silicon。通过SYCL使用Intel Arc的Linux被标记为实验性/Tier C。已测试的发行版包括Ubuntu、Debian、Linux Mint、Fedora、Rocky Linux、Arch、Manjaro、CachyOS和openSUSE Tumbleweed。macOS需要Apple Silicon,并以Metal加速原生运行llama-server,其他服务则在Docker中运行。
硬件检测与模型
安装程序会检测GPU、分配硬件层级,并根据内存范围从版本化目录(model-library.json)中选择模型。所选结果会以LLM_MODEL、GGUF_FILE、MAX_CONTEXT和MODEL_RECOMMENDATION_*变量写入.env。诸如MODEL_PROFILE=qwen、gemma4或auto之类的配置会影响所选模型系列,层级选择也可以在安装时覆盖。README列出了针对NVIDIA、AMD Strix Halo、Apple Silicon和Intel Arc内存范围的示例目录选择,并指出实际安装可能有所不同,吞吐量需要本地基准测试。
引导模式
默认情况下,ODS会先下载一个1.5B的小模型,以便用户快速开始聊天,然后在后台下载完整模型并热切换到该模型。可以使用--no-bootstrap跳过引导。
模型管理与CLI
ods CLI涵盖状态与健康检查、服务列表、日志、重启、启动/停止、在本地/云端/混合模式之间切换、模型层级切换、启用或禁用扩展、查看脱敏配置,以及保存或加载预设。如果新模型加载失败,模型回滚被描述为自动进行。
可扩展性
每个服务都被视为一个扩展:一个包含manifest.yaml和compose.yaml的文件夹,由仪表板、CLI、健康检查和compose栈自动发现。安装程序本身被描述为模块化,包含库模块、共享服务注册表和有序阶段。
定位
README将ODS定位为一种避免手动拼接Ollama/llama.cpp、Open WebUI、n8n和隐私工具的方式,并通过增加外围服务器栈、安装程序和控制平面来与这些项目进行比较。它强调本地优先运行,并提供可选的云端或混合API模式,同时声明除非用户另行选择,否则提示和数据都保留在本机。
评论
0 评分人数达到10人后显示
登录后参与讨论。