À propos du projet

DeepSpeed est une bibliothèque d'optimisation système qui permet l'entraînement de modèles de deep learning massifs, y compris ceux comptant des centaines de milliards de paramètres. Elle propose une suite d'innovations pour surmonter les goulots d'étranglement de mémoire et de calcul, telles que ZeRO (Zero Redundancy Optimizer), ZeRO-Infinity, 3D-Parallelism, Ulysses Sequence Parallelism et DeepSpeed-MoE. La bibliothèque est intégrée à plusieurs frameworks open-source populaires, notamment Hugging Face Transformers, Accelerate, PyTorch Lightning, MosaicML, Determined et MMEngine. Elle prend en charge une large gamme d'accélérateurs matériels, dont les GPU NVIDIA (de Pascal à Hopper), les GPU AMD (MI100, MI200), Intel Gaudi, les CPU Intel Xeon, la série Intel Data Center GPU Max et les NPU Huawei Ascend. Les capacités clés incluent : - L'optimisation de la mémoire pour les modèles de mille milliards de paramètres via ZeRO. - L'entraînement et l'inférence distribués efficaces pour les modèles basés sur Transformer. - Le support pour l'entraînement de séquences longues et le mélange d'experts (MoE). - Des moteurs de déchargement avancés (par exemple, ZenFlow, SuperOffload) pour exploiter la mémoire CPU et NVMe.