À propos du projet

Machine Learning Engineering Open Book est un référentiel pratique et axé sur l'expérience, créé par Stas Bekman, qui documente les méthodologies, les outils et les commandes copier-coller pour l'entraînement et l'exploitation de grands modèles de langage (LLM) et de modèles vision-langage (VLM). Le contenu s'appuie sur un travail pratique avec BLOOM-176B, IDEFICS-80B et les systèmes RAG chez Contextual.AI. Le référentiel est organisé en sept parties : des perspectives sur l'ingénierie de l'IA et les décisions concernant le cloud et les GPU ; des conseils matériels couvrant le calcul, le stockage et la mise en réseau ; les systèmes d'orchestration, y compris SLURM ; des guides d'entraînement et d'inférence ; des ressources de développement pour le débogage, les tests et le dépannage ; et des ressources diverses telles que des journaux d'entraînement LLM/VLM. Les outils pratiques incluent des scripts de benchmark réseau comme all_reduce_bench.py, des tests de connectivité inter-nœuds avec torch-distributed-gpu-test.py, et la mesure des TFLOPS des accélérateurs via mamf-finder.py. Le projet fournit également des tableaux de comparaison des performances des accélérateurs et des vitesses réseau, un fichier SKILL.md pour enseigner aux agents d'IA, et des versions téléchargeables en ebook PDF/EPUB. Le contenu est sous licence CC BY-SA 4.0 et les contributions et discussions de la communauté sont les bienvenues.