À propos du projet

Rapid-MLX est un moteur d'IA local hautes performances conçu spécifiquement pour Apple Silicon (M1-M4). Il constitue un remplacement direct des API OpenAI et Anthropic, permettant aux clients existants comme Claude Code, Cursor, Aider et LangChain de se connecter sans adaptateurs. Les principales fonctionnalités incluent : - **Performance** : revendique jusqu'à 3x le débit d'Ollama avec des noyaux MLX natifs, le continuous batching, la mise en cache des prompts et un cache KV quantifié. - **Compatibilité API** : prend en charge `/v1/chat/completions`, `/v1/responses`, `/v1/messages`, `/v1/embeddings`, `/v1/audio/*`, `/v1/videos` et `/v1/images/*`. - **Prise en charge des modèles** : texte, vision, audio (TTS/STT/clonage vocal), génération vidéo, génération d'images et embeddings. Comprend un catalogue de modèles avec des alias pour diverses tailles et exigences de mémoire. - **Intégration d'agents** : compatibilité vérifiée par câblage avec 12 CLI d'agents (par ex. Claude Code, Codex CLI, Aider) et 3 frameworks Python (LangChain, PydanticAI, smolagents). Les agents de niveau 1 sont revérifiés de bout en bout sur des poids réels avant chaque version. - **Installation** : disponible via Homebrew, pip ou un installateur guidé. Application de bureau pour macOS. - **Cas d'usage** : chat en terminal, serveur compatible OpenAI pour applications, backends d'agents et benchmarking. - **Extras** : paquets optionnels pour les capacités d'image, de vidéo, d'audio et system-one (décisions typées). Rapid-MLX se positionne comme une alternative locale rapide pour les développeurs et les passionnés d'IA sur matériel Apple, en mettant l'accent sur la performance, la compatibilité et la facilité d'utilisation.