À propos du projet

Ce dépôt est une ressource éducative organisée qui distille les 107 articles de recherche les plus influents façonnant l'IA générative moderne en résumés accessibles et complets. Conçu pour les praticiens, les étudiants et les passionnés qui n'ont pas le temps de lire plus de 220 000 mots de littérature académique dense, il fournit des parcours d'apprentissage structurés, des références rapides et des guides de décision couvrant l'ensemble du paysage de l'IA générative. La collection est organisée en cinq catégories principales : Architectures fondamentales (11 articles), Modèles de langage (25 articles), Génération d'images (14 articles), Multimodal (7 articles), et Techniques et méthodes (50 articles). Chaque résumé d'article est placé dans son propre répertoire avec un fichier summary.md dédié, numéroté dans l'ordre de son ajout à la collection. Les articles clés couverts incluent Attention Is All You Need (2017), BERT (2018), GPT-3 (2020), GPT-4 (2023), GPT-4o (2024), GPT-5 (2025), la série LLaMA (2023-2025), DeepSeek-V3 et DeepSeek-R1 (2024-2025), Qwen3 (2025), Claude 3.5 Sonnet et la famille Claude 4 (2024-2026), Gemini 2.5 et Gemini 3 (2025), Stable Diffusion (2022), DALL-E 3 (2023), Sora/DiT (2024), CLIP (2021), Whisper (2022), LLaVA (2023), GPT-4V (2023), SAM 2 (2024), et bien d'autres. Le dépôt comprend une documentation complète : une feuille de route d'apprentissage avec quatre parcours structurés du débutant à l'expert, un guide de lecture distinguant le contexte historique de la pertinence moderne, une référence rapide en une page, des comparaisons côte à côte avec analyse des compromis, un glossaire de plus de 150 termes clés, et une carte de couverture et des lacunes montrant ce que la collection couvre et ce qui est prévu ensuite. Les articles sont également indexés par catégorie (INDEX.md), par étiquette thématique sur 45 sujets (TAGS.md), et dans une vue en grille visuelle (BROWSE.md). Des manifestes lisibles par machine sont fournis sous forme de papers.json et papers.csv, générés par un pipeline de construction Python uniquement basé sur la bibliothèque standard (scripts/build_manifest.py) qui régénère également le front-matter, INDEX.md, TAGS.md et la navigation du site. Des scripts supplémentaires gèrent le cross-linking (add_cross_links.py) et la validation des liens relatifs (check_links.py) comme passerelle CI. Le site de documentation est publié à l'adresse patrickwiloak.github.io/genai-research-papers-summarized, avec recherche, mode sombre et aucune inscription requise. Le site est construit avec MkDocs en utilisant une configuration mkdocs.yml maintenue à la main. Chaque résumé d'article inclut un indicateur de pertinence (CRITICAL, HIGH, HISTORICAL ou THEORY), les contributions clés et des liens vers l'article original ou la fiche système. La collection met l'accent sur la compréhension pratique — expliquant non seulement ce que chaque article a fait, mais pourquoi cela compte et comment cela se connecte aux systèmes modernes. Par exemple, le résumé ResNet explique que les connexions résiduelles (x + f(x)) se trouvent dans chaque bloc Transformer jamais entraîné, tandis que le résumé sur l'attention à requêtes groupées explique pourquoi le contexte long et l'inférence locale sont désormais abordables. Le dépôt est maintenu par Patrick Wiloak chez Nobler Works, un cabinet de conseil en logiciels sur mesure. Il est sous licence CC BY 4.0 et accepte les contributions via un flux de travail documenté dans CONTRIBUTING.md. La collection a été mise à jour pour la dernière fois en août 2026.