À propos du projet

Megatron-LM est un exemple de référence qui regroupe Megatron Core avec des scripts d'entraînement préconfigurés, destiné aux équipes de recherche, à l'apprentissage de l'entraînement distribué et à l'expérimentation rapide. Megatron Core est une bibliothèque composable de blocs de construction optimisés pour GPU destinés aux frameworks d'entraînement personnalisés, offrant des composants de transformateurs, des stratégies de parallélisme avancées (parallélisme tensoriel, pipeline, données, expert et contexte), la prise en charge de la précision mixte (FP16, BF16, FP8 et FP4) et des architectures de modèles. Le dépôt comprend également des moteurs d'inférence, des utilitaires d'exportation de modèles, des outils de post-entraînement tels que la quantification et la distillation, ainsi que la prise en charge de l'apprentissage par renforcement, y compris RLHF. Megatron Bridge fournit une conversion bidirectionnelle de points de contrôle entre les formats Hugging Face et Megatron. Le projet rapporte l'entraînement de modèles de 2B à 462B paramètres sur des milliers de GPU, avec jusqu'à 47 % d'utilisation de flops de modèle sur des clusters H100. L'installation est disponible via PyPI ou à partir des sources, et la documentation couvre les premiers entraînements, les stratégies de parallélisme et les directives de contribution.