Sobre el proyecto

mlx-serve es un servidor nativo para ejecutar modelos de lenguaje grandes localmente en Macs con Apple Silicon. Está escrito en Zig y no requiere Python en tiempo de ejecución; se distribuye como un binario pequeño junto con una app opcional firmada para la barra de menús de macOS llamada MLX Core. El soporte de modelos abarca arquitecturas MLX nativas (Gemma, Qwen, Llama, Mistral, DeepSeek, Hunyuan y otras), así como el ecosistema más amplio de GGUF mediante un llama.cpp integrado, enrutado automáticamente según el formato. Los modelos se pueden descargar desde Hugging Face por nombre corto, id org/repo o name:tag, y se cargan bajo demanda por nombre. En el lado de la API, el servidor expone varias superficies compatibles en un solo puerto: OpenAI chat/completions y Responses (incluido un transporte WebSocket), Anthropic Messages y la API de Ollama. Esto significa que los clientes y agentes de programación existentes que hablan cualquiera de estos protocolos pueden apuntar al endpoint local sin modificaciones. Streaming, llamada a herramientas con reparación guiada por esquema, decodificación restringida por esquema JSON, logprobs, entrada de visión y contenido de razonamiento se encuentran entre las funciones de servicio compatibles. Más allá del texto, el mismo servidor ofrece endpoints para generación de imágenes, vídeo, audio/voz (con clonación de voz), música y modelos 3D, con varias opciones de modelo listadas por modalidad y requisitos aproximados de memoria. Una consola web integrada proporciona un playground de chat, monitorización y herramientas de medios. La app MLX Core añade chat multis sesión, un modo agente con herramientas integradas y soporte MCP, un sandbox de VM Linux aislado para comandos de shell del agente, un navegador de modelos con descargas reanudables, modo de voz, tareas programadas, uso compartido de modelos en LAN entre Macs y una ventana de ajustes para flags del servidor. El README también documenta variantes de decodificación especulativa, cuantización de caché KV, batching continuo y caché, y enlaces a documentación de benchmarks y rendimiento. La instalación está disponible mediante casks de Homebrew o compilando desde el código fuente con Xcode y la cadena de herramientas Metal. El proyecto tiene licencia MIT e incluye componentes de terceros bajo sus propias licencias, con atribuciones listadas en un archivo NOTICE.