Sobre o projeto
SkyPilot é um sistema para executar, gerenciar e escalar cargas de trabalho de IA em qualquer infraestrutura de IA. Ele atende dois públicos: equipes de IA que desejam uma interface simples para lançar jobs em qualquer infraestrutura, e equipes de infraestrutura que precisam de um plano de controle unificado com agendamento, escalonamento e orquestração.
Capacidades principais descritas no README:
- Interface unificada: uma tarefa é definida uma vez (YAML ou API Python) com requisitos de recursos, workdir, comandos de setup e comandos de execução, e então lançada em qualquer infraestrutura disponível. Isso é apresentado como uma forma de evitar vendor lock-in e mover jobs entre provedores.
- Suporte a múltiplas infraestruturas: Kubernetes, Slurm e uma longa lista de nuvens e provedores, incluindo AWS, GCP, Azure, OCI, CoreWeave, Nebius, Lambda Cloud, RunPod, Fluidstack, Cudo, Digital Ocean, Paperspace, Cloudflare, IBM, Vast.ai, VMware vSphere, Seeweb, Prime Intellect, Shadeform, Verda Cloud e Crusoe.
- Provisionamento e failover: o SkyPilot encontra infraestrutura disponível, provisiona GPUs/TPUs/CPUs e pode fazer failover automaticamente quando ocorrem erros de capacidade.
- Gerenciamento de jobs: enfileiramento, execução e recuperação automática de muitos jobs, além de autostop para limpeza de recursos ociosos e binpacking em clusters compartilhados.
- Experiência com Kubernetes: SSH em pods, sincronização de código, conexão de uma IDE, gang scheduling, jobs multinó, plano de controle multicluster e multinuvem.
- Recursos para equipes: implantação via um servidor de API e compartilhamento de recursos.
- Integração com agentes: uma Skill do SkyPilot pode ser instalada para que agentes de codificação como Claude Code ou Codex possam operar o SkyPilot.
A instalação é feita via uv ou pip com extras para nuvens selecionadas. O README também aponta para um quickstart, uma referência de especificação YAML, exemplos executáveis para treinamento (Verl, finetuning do Llama 4, TorchTitan, PyTorch, DeepSpeed, NeMo, Ray, Unsloth, Jax/TPU, OpenRLHF), serving (vLLM, SGLang, Ollama), modelos (DeepSeek-R1, Llama 4, Llama 3, CodeLlama, Qwen, Kimi-K2, Mixtral), aplicações de IA (RAG, bancos de dados vetoriais) e frameworks (Airflow, Jupyter, marimo).
O projeto afirma ser BYOC: os recursos são lançados dentro das próprias contas de nuvem, VPCs e clusters do usuário. Documentação, um blog, Slack, GitHub Discussions e issue tracker estão vinculados para suporte e contribuições.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.