这个项目能做什么

mlx-serve 是一个原生服务器,用于在 Apple Silicon Mac 上本地运行大型语言模型。它使用 Zig 编写,运行时无需 Python,以小型二进制文件形式分发,并附带一个可选的签名 macOS 菜单栏应用,名为 MLX Core。 模型支持涵盖原生 MLX 架构(如 Gemma、Qwen、Llama、Mistral、DeepSeek、Hunyuan 等),以及通过嵌入式 llama.cpp 支持的更广泛的 GGUF 生态系统,并根据格式自动路由。模型可通过短名称、组织/仓库 ID 或名称:标签从 Hugging Face 拉取,并按名称按需加载。 在 API 方面,服务器在单个端口上提供多种兼容接口:OpenAI 聊天/补全和 Responses(包括 WebSocket 传输)、Anthropic Messages 以及 Ollama API。这意味着使用这些协议的任何现有客户端和编码代理都可以直接指向本地端点,无需修改。支持的功能包括流式传输、带模式驱动修复的工具调用、JSON 模式约束解码、logprobs、视觉输入和推理内容。 除了文本,同一服务器还提供图像、视频、音频/语音(含语音克隆)、音乐和 3D 模型生成端点,每种模态列出多个模型选项及大致内存需求。内置 Web 控制台提供聊天游乐场、监控和媒体工具。 MLX Core 应用增加了多会话聊天、带内置工具和 MCP 支持的代理模式、用于代理 shell 命令的隔离 Linux VM 沙箱、带可恢复下载的模型浏览器、语音模式、定时任务、Mac 之间的局域网模型共享,以及用于服务器标志的设置窗口。 README 还记录了推测解码变体、KV 缓存量化、连续批处理和缓存,并链接到基准和性能文档。可通过 Homebrew casks 安装,或使用 Xcode 和 Metal 工具链从源码构建。该项目采用 MIT 许可,并捆绑了各自许可下的第三方组件,归属信息列在 NOTICE 文件中。