프로젝트 소개
mlx-serve는 Apple Silicon Mac에서 대규모 언어 모델을 로컬로 실행하기 위한 네이티브 서버입니다. Zig로 작성되었으며 런타임에 Python이 필요하지 않고, 작은 바이너리와 선택적 서명 macOS 메뉴바 앱인 MLX Core로 제공됩니다.
모델 지원은 네이티브 MLX 아키텍처(Gemma, Qwen, Llama, Mistral, DeepSeek, Hunyuan 등)와 내장 llama.cpp를 통한 더 넓은 GGUF 생태계를 포함하며, 형식에 따라 자동으로 라우팅됩니다. 모델은 짧은 이름, org/repo id 또는 name:tag로 Hugging Face에서 가져올 수 있으며, 이름으로 요청 시 로드됩니다.
API 측면에서 서버는 하나의 포트에서 여러 호환 인터페이스를 노출합니다: OpenAI chat/completions 및 Responses(WebSocket 전송 포함), Anthropic Messages, Ollama API. 즉, 이러한 프로토콜 중 하나를 사용하는 기존 클라이언트와 코딩 에이전트는 수정 없이 로컬 엔드포인트를 가리킬 수 있습니다. 스트리밍, 스키마 기반 복구를 통한 도구 호출, JSON 스키마 제약 디코딩, logprobs, 비전 입력 및 추론 콘텐츠가 지원되는 서빙 기능에 포함됩니다.
텍스트 외에도 동일한 서버는 이미지, 비디오, 오디오/음성(음성 복제 포함), 음악 및 3D 모델 생성 엔드포인트를 제공하며, 모달리티별로 여러 모델 옵션과 대략적인 메모리 요구 사항이 나열되어 있습니다. 내장 웹 콘솔은 채팅 플레이그라운드, 모니터링 및 미디어 도구를 제공합니다.
MLX Core 앱은 다중 세션 채팅, 내장 도구와 MCP 지원이 있는 에이전트 모드, 에이전트 셸 명령을 위한 격리된 Linux VM 샌드박스, 재개 가능한 다운로드가 있는 모델 브라우저, 음성 모드, 예약 작업, Mac 간 LAN 모델 공유, 서버 플래그를 위한 설정 창을 추가합니다.
README는 또한 추측 디코딩 변형, KV 캐시 양자화, 연속 배칭 및 캐싱을 문서화하고 벤치마크 및 성능 문서 링크를 제공합니다. 설치는 Homebrew cask를 통해 또는 Xcode와 Metal 툴체인으로 소스에서 빌드하여 가능합니다. 이 프로젝트는 MIT 라이선스이며 자체 라이선스 하에 타사 구성 요소를 번들로 포함하고, NOTICE 파일에 저작자 표시가 나열되어 있습니다.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.