Об этом проекте

DeepSpeed представляет собой библиотеку системной оптимизации, которая позволяет обучать массивные модели глубокого обучения, в том числе содержащие сотни миллиардов параметров. Она предоставляет набор инноваций для преодоления узких мест в памяти и вычислениях, таких как ZeRO (Zero Redundancy Optimizer), ZeRO-Infinity, 3D-Parallelism, Ulysses Sequence Parallelism и DeepSpeed-MoE. Библиотека интегрирована с несколькими популярными open-source фреймворками, включая Hugging Face Transformers, Accelerate, PyTorch Lightning, MosaicML, Determined и MMEngine. Она поддерживает широкий спектр аппаратных ускорителей, включая NVIDIA GPU (от Pascal до Hopper), AMD GPU (MI100, MI200), Intel Gaudi, Intel Xeon CPU, Intel Data Center GPU Max серии и Huawei Ascend NPU. Ключевые возможности включают: - Оптимизация памяти для моделей с триллионом параметров с помощью ZeRO. - Эффективное распределенное обучение и вывод для моделей на базе Transformer. - Поддержка обучения длинных последовательностей и архитектуры mixture-of-experts (MoE). - Продвинутые механизмы offloading (например, ZenFlow, SuperOffload) для использования памяти CPU и NVMe.