Sobre el proyecto

Colossal-AI es un proyecto de código abierto de HPC-AI Tech que proporciona una colección de componentes paralelos para aprendizaje profundo distribuido, con el objetivo de hacer que los grandes modelos de IA sean más económicos, rápidos y accesibles. Permite a los usuarios escribir código de entrenamiento e inferencia distribuidos con cambios mínimos, impulsado en gran medida por archivos de configuración. Las capacidades clave descritas en el README incluyen estrategias de paralelismo como paralelismo de datos, paralelismo de tubería, paralelismo de tensores 1D/2D/2.5D/3D, paralelismo de secuencia, ZeRO y auto-paralelismo. También incluye gestión de memoria heterogénea a través de PatrickStar. El proyecto destaca aplicaciones y ejemplos del mundo real: Open-Sora para modelos de generación de video, Colossal-LLaMA-2 para entrenamiento de LLMs específicos del dominio, ColossalChat con un pipeline completo de RLHF, aceleración del entrenamiento e inferencia de Stable Diffusion, y FastFold para trabajo de estructuras de proteínas AlphaFold. Las demostraciones de entrenamiento paralelo cubren LLaMA 1/2/3, MoE, GPT-3, GPT-2, BERT, PaLM, OPT, ViT y modelos de recomendación, además de demostraciones de GPU individual y componentes de inferencia como Colossal-Inference, soporte para Grok-1 y SwiftInfer. La instalación está disponible a través de PyPI o desde el código fuente, y se documenta el uso de Docker. El README también enlaza a documentación, ejemplos, un foro y canales comunitarios. Cabe señalar que el README contiene contenido promocional para los servicios de GPU en la nube de HPC-AI Cloud y APIs de modelos; estos son ofertas comerciales y no parte de la biblioteca de código abierto en sí.