프로젝트 소개

exo는 exo labs가 유지 관리하는 오픈소스 프로젝트로, 여러 기기를 로컬 AI 클러스터로 전환합니다. 명시된 목표는 단일 기기에 맞지 않는 더 큰 모델을 포함한 최첨단 AI 모델을 로컬에서 실행하는 것입니다. README는 자동 장치 검색을 강조하며, exo를 실행하는 기기들이 수동 구성 없이 서로를 찾을 수 있습니다. 문서화된 주요 기능: - exo를 실행하는 기기 간 자동 장치 검색. - Thunderbolt 5를 통한 RDMA 지원은 day-0로 설명되며, README는 기기 간 지연 시간을 99% 줄인다고 주장합니다. - 토폴로지 인식 자동 병렬 처리: 시스템은 기기 리소스와 네트워크 지연 시간/대역폭을 기반으로 사용 가능한 기기에 모델을 분할하는 방법을 선택합니다. - 텐서 병렬 처리: README에 따르면 2개 기기에서 최대 1.8배, 4개 기기에서 3.2배 속도 향상. - 추론 백엔드로 MLX를 사용하며, 통신에는 MLX distributed를 사용합니다. - OpenAI Chat Completions, Claude Messages, OpenAI Responses, Ollama API와의 호환성. - HuggingFace 허브에서 사용자 정의 모델 로드. - 클러스터 관리 및 모델과 채팅을 위한 내장 대시보드, http://localhost:52415에서 제공. README에 설명된 설치 방법에는 macOS 및 Linux에서 소스로 실행, Nix flake 명령, DMG 또는 Homebrew cask로 배포되는 macOS 앱이 포함됩니다. macOS에서는 GPU를 사용하고, Linux에서는 현재 CPU에서 실행되며 GPU 지원은 개발 중입니다. README는 또한 모델 디렉터리, 오프라인 모드, 이미지 모델, 클러스터 네임스페이스 격리, 추적을 위한 환경 변수와 exo-bench라는 벤치마킹 도구를 문서화합니다. README의 벤치마크 이미지는 Jeff Geerling의 것으로, 텐서 병렬 RDMA를 사용하는 4대의 M3 Ultra Mac Studio 머신에서 Qwen3-235B, DeepSeek v3.1 671B, Kimi K2 Thinking이 실행되는 모습을 보여줍니다. 이는 이 디렉터리의 독립적 검증이 아닌 타사 측정값입니다. 라이선스는 Apache-2.0입니다. 프로젝트는 Discord 커뮤니티와 업데이트용 X 계정을 제공합니다.