このプロジェクトについて

mlx-serveは、Apple Silicon搭載Mac上で大規模言語モデルをローカルに実行するためのネイティブサーバーです。Zigで書かれており、実行時にPythonを必要とせず、オプションの署名付きmacOSメニューバーアプリ「MLX Core」と共に小さなバイナリとして配布されます。 モデルサポートは、ネイティブのMLXアーキテクチャ(Gemma、Qwen、Llama、Mistral、DeepSeek、Hunyuanなど)と、組み込みのllama.cppを通じたより広範なGGUFエコシステムをカバーし、フォーマットに応じて自動的にルーティングされます。モデルは、短い名前、組織/リポジトリID、または名前:タグでHugging Faceからプルでき、名前でオンデマンドにロードされます。 API面では、サーバーは1つのポートで複数の互換サーフェスを公開します:OpenAIのchat/completionsとResponses(WebSocketトランスポートを含む)、Anthropic Messages、そしてOllama APIです。つまり、これらのプロトコルのいずれかを話す既存のクライアントやコーディングエージェントは、変更なしでローカルエンドポイントを指すことができます。ストリーミング、スキーマ駆動の修復を伴うツール呼び出し、JSONスキーマ制約付きデコード、ログプロブ、ビジョン入力、推論コンテンツは、サポートされているサービング機能の一部です。 テキスト以外にも、同じサーバーは画像、ビデオ、オーディオ/音声(音声クローン付き)、音楽、3Dモデル生成のエンドポイントを提供し、各モダリティにつき複数のモデルオプションとおおよそのメモリ要件がリストされています。組み込みのWebコンソールは、チャットプレイグラウンド、モニタリング、メディアツールを提供します。 MLX Coreアプリは、マルチセッションチャット、組み込みツールとMCPサポートを備えたエージェントモード、エージェントのシェルコマンド用の隔離されたLinux VMサンドボックス、再開可能なダウンロードを備えたモデルブラウザ、音声モード、スケジュールされたタスク、Mac間のLANモデル共有、サーバーフラグ用の設定ウィンドウを追加します。 READMEには、投機的デコードのバリエーション、KVキャッシュ量子化、連続バッチ処理とキャッシングも文書化されており、ベンチマークとパフォーマンスのドキュメントへのリンクがあります。インストールは、Homebrew caskを通じて、またはXcodeとMetalツールチェーンを使用してソースからビルドすることで利用可能です。プロジェクトはMITライセンスであり、サードパーティコンポーネントをそれぞれのライセンスの下でバンドルし、帰属はNOTICEファイルに記載されています。