À propos du projet
exo est un projet open source maintenu par exo labs qui transforme un ensemble d'appareils en un cluster IA local. Son objectif déclaré est d'exécuter localement des modèles d'IA de pointe, y compris des modèles trop volumineux pour tenir sur un seul appareil. Le README met l'accent sur la découverte automatique d'appareils : les appareils exécutant exo se trouvent mutuellement sans configuration manuelle.
Capacités documentées clés :
- Découverte automatique d'appareils entre les machines exécutant exo.
- Prise en charge de RDMA sur Thunderbolt 5, décrite comme "day-0", le README affirmant une réduction de 99 % de la latence entre les appareils.
- Parallélisme automatique sensible à la topologie : le système choisit comment répartir un modèle entre les appareils disponibles en fonction des ressources de l'appareil et de la latence/bande passante du réseau.
- Parallélisme tensoriel, le README indiquant une accélération allant jusqu'à 1,8x sur 2 appareils et 3,2x sur 4 appareils.
- MLX comme backend d'inférence, avec MLX distribué pour la communication.
- Compatibilité API avec OpenAI Chat Completions, Claude Messages, OpenAI Responses et les API Ollama.
- Chargement de modèles personnalisés depuis le hub HuggingFace.
- Un tableau de bord intégré pour la gestion du cluster et la discussion avec les modèles, servi à http://localhost:52415.
Les chemins d'installation décrits dans le README incluent l'exécution depuis les sources sur macOS et Linux, une commande flake Nix, et une application macOS distribuée en DMG ou via Homebrew cask. Sur macOS, le projet utilise le GPU ; sur Linux, il fonctionne actuellement sur CPU, le support GPU étant indiqué comme en cours de développement. Le README documente également les variables d'environnement pour les répertoires de modèles, le mode hors ligne, les modèles d'images, l'isolation des espaces de noms du cluster et le tracing, ainsi qu'un outil de benchmark appelé exo-bench.
Les images de benchmark du README sont attribuées à Jeff Geerling et montrent Qwen3-235B, DeepSeek v3.1 671B et Kimi K2 Thinking s'exécutant sur quatre machines Mac Studio M3 Ultra avec parallélisme tensoriel RDMA. Ce sont des mesures tierces, et non une vérification indépendante de ce répertoire.
La licence est Apache-2.0. Le projet fournit une communauté Discord et un compte X pour les mises à jour.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.