Sobre el proyecto
exo es un proyecto de código abierto mantenido por exo labs que convierte un conjunto de dispositivos en un clúster de IA local. Su objetivo declarado es ejecutar modelos de IA de vanguardia localmente, incluidos modelos más grandes de los que cabrían en un solo dispositivo. El README enfatiza el descubrimiento automático de dispositivos, por lo que los dispositivos que ejecutan exo se encuentran entre sí sin configuración manual.
Capacidades documentadas clave:
- Descubrimiento automático de dispositivos entre máquinas que ejecutan exo.
- Soporte de RDMA sobre Thunderbolt 5, descrito como day-0, y el README afirma una reducción del 99% en la latencia entre dispositivos.
- Auto-paralelo consciente de la topología: el sistema elige cómo dividir un modelo entre los dispositivos disponibles según los recursos del dispositivo y la latencia/ancho de banda de la red.
- Paralelismo tensorial, y el README afirma una aceleración de hasta 1.8x en 2 dispositivos y 3.2x en 4 dispositivos.
- MLX como backend de inferencia, con MLX distribuido para la comunicación.
- Compatibilidad de API con OpenAI Chat Completions, Claude Messages, OpenAI Responses y Ollama APIs.
- Carga de modelos personalizados desde el hub de HuggingFace.
- Un panel integrado para la gestión del clúster y el chat con modelos, servido en http://localhost:52415.
Las rutas de instalación descritas en el README incluyen ejecutarlo desde el código fuente en macOS y Linux, un comando Nix flake y una aplicación para macOS distribuida como DMG o mediante Homebrew cask. En macOS el proyecto utiliza la GPU; en Linux actualmente se ejecuta en CPU, y el soporte de GPU está marcado como en desarrollo. El README también documenta variables de entorno para directorios de modelos, modo sin conexión, modelos de imagen, aislamiento de espacio de nombres del clúster y trazado, además de una herramienta de evaluación comparativa llamada exo-bench.
Las imágenes de evaluaciones comparativas en el README se atribuyen a Jeff Geerling y muestran Qwen3-235B, DeepSeek v3.1 671B y Kimi K2 Thinking ejecutándose en cuatro máquinas Mac Studio M3 Ultra con RDMA de paralelismo tensorial. Son mediciones de terceros, no una verificación independiente por parte de este directorio.
La licencia es Apache-2.0. El proyecto ofrece una comunidad de Discord y una cuenta de X para actualizaciones.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.