프로젝트 소개
SkyPilot은 모든 AI 인프라에서 AI 워크로드를 실행, 관리 및 확장하기 위한 시스템입니다. 두 가지 대상을 겨냥합니다. 어떤 인프라에서든 간단한 인터페이스로 작업을 시작하려는 AI 팀과, 스케줄링·확장·오케스트레이션을 갖춘 통합 제어 플레인이 필요한 인프라 팀입니다.
README에 설명된 핵심 기능:
- 통합 인터페이스: 작업을 리소스 요구 사항, workdir, 설정 명령, 실행 명령과 함께 한 번 정의(YAML 또는 Python API)한 다음 사용 가능한 모든 인프라에서 시작합니다. 이는 벤더 종속을 피하고 제공자 간에 작업을 이동하는 방법으로 제시됩니다.
- 멀티 인프라 지원: Kubernetes, Slurm, 그리고 AWS, GCP, Azure, OCI, CoreWeave, Nebius, Lambda Cloud, RunPod, Fluidstack, Cudo, Digital Ocean, Paperspace, Cloudflare, IBM, Vast.ai, VMware vSphere, Seeweb, Prime Intellect, Shadeform, Verda Cloud, Crusoe를 포함한 긴 클라우드 및 제공자 목록.
- 프로비저닝 및 장애 조치: SkyPilot은 사용 가능한 인프라를 찾고 GPU/TPU/CPU를 프로비저닝하며 용량 오류가 발생하면 자동으로 장애 조치할 수 있습니다.
- 작업 관리: 많은 작업의 큐잉, 실행 및 자동 복구와 유휴 리소스 정리를 위한 자동 종료, 공유 클러스터에서의 빈 패킹.
- Kubernetes 경험: 포드로 SSH 접속, 코드 동기화, IDE 연결, 갱 스케줄링, 멀티 노드 작업, 멀티 클러스터 및 멀티 클라우드 제어 플레인.
- 팀 기능: API 서버를 통한 배포와 리소스 공유.
- 에이전트 통합: Claude Code나 Codex 같은 코딩 에이전트가 SkyPilot을 구동할 수 있도록 SkyPilot Skill을 설치할 수 있습니다.
설치는 uv 또는 pip를 통해 선택한 클라우드용 extras와 함께 진행합니다. README는 또한 퀵스타트, YAML 스펙 참조, 학습(Verl, Llama 4 파인튜닝, TorchTitan, PyTorch, DeepSpeed, NeMo, Ray, Unsloth, Jax/TPU, OpenRLHF), 서빙(vLLM, SGLang, Ollama), 모델(DeepSeek-R1, Llama 4, Llama 3, CodeLlama, Qwen, Kimi-K2, Mixtral), AI 애플리케이션(RAG, 벡터 데이터베이스), 프레임워크(Airflow, Jupyter, marimo)에 대한 실행 가능한 예제를 안내합니다.
이 프로젝트는 BYOC라고 명시합니다. 리소스는 사용자 자신의 클라우드 계정, VPC 및 클러스터 내에서 시작됩니다. 문서, 블로그, Slack, GitHub Discussions 및 이슈 트래커가 지원과 기여를 위해 링크되어 있습니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.