Sobre el proyecto

SkyPilot es un sistema para ejecutar, gestionar y escalar cargas de trabajo de IA en cualquier infraestructura de IA. Está dirigido a dos públicos: equipos de IA que desean una interfaz sencilla para lanzar trabajos en cualquier infraestructura, y equipos de infraestructura que necesitan un plano de control unificado con planificación, escalado y orquestación. Capacidades principales descritas en el README: - Interfaz unificada: una tarea se define una sola vez (YAML o API de Python) con requisitos de recursos, directorio de trabajo, comandos de configuración y comandos de ejecución, y luego se lanza en cualquier infraestructura disponible. Esto se presenta como una forma de evitar la dependencia de un proveedor y mover trabajos entre proveedores. - Soporte multiinfraestructura: Kubernetes, Slurm y una larga lista de nubes y proveedores que incluye AWS, GCP, Azure, OCI, CoreWeave, Nebius, Lambda Cloud, RunPod, Fluidstack, Cudo, Digital Ocean, Paperspace, Cloudflare, IBM, Vast.ai, VMware vSphere, Seeweb, Prime Intellect, Shadeform, Verda Cloud y Crusoe. - Aprovisionamiento y conmutación por error: SkyPilot encuentra infraestructura disponible, aprovisiona GPU/TPU/CPU y puede conmutar automáticamente por error cuando se producen errores de capacidad. - Gestión de trabajos: puesta en cola, ejecución y recuperación automática de muchos trabajos, además de parada automática para limpiar recursos inactivos y empaquetado en clústeres compartidos. - Experiencia Kubernetes: SSH en pods, sincronización de código, conexión de un IDE, planificación en grupo, trabajos multinodo, plano de control multiclúster y multinube. - Funciones para equipos: despliegue mediante un servidor API y uso compartido de recursos. - Integración con agentes: se puede instalar una SkyPilot Skill para que agentes de codificación como Claude Code o Codex puedan controlar SkyPilot. La instalación se realiza mediante uv o pip con extras para las nubes seleccionadas. El README también enlaza a una guía de inicio rápido, una referencia de especificación YAML, ejemplos ejecutables para entrenamiento (Verl, ajuste fino de Llama 4, TorchTitan, PyTorch, DeepSpeed, NeMo, Ray, Unsloth, Jax/TPU, OpenRLHF), inferencia (vLLM, SGLang, Ollama), modelos (DeepSeek-R1, Llama 4, Llama 3, CodeLlama, Qwen, Kimi-K2, Mixtral), aplicaciones de IA (RAG, bases de datos vectoriales) y frameworks (Airflow, Jupyter, marimo). El proyecto indica que es BYOC: los recursos se lanzan dentro de las cuentas de nube, VPC y clústeres propios del usuario. Se enlazan documentación, un blog, Slack, GitHub Discussions y el rastreador de incidencias para soporte y contribuciones.