À propos du projet

Ce dépôt héberge le code accompagnant Machine Learning for Trading, 3e édition de Stefan Jansen. Il est organisé autour d'un flux de travail unique de bout en bout : définir une idée de recherche et la développer de manière itérative en une stratégie pouvant être exécutée et maintenue sur un marché en direct. Le matériel couvre 27 chapitres et neuf études de cas, passant des données brutes aux caractéristiques, modèles, backtests, coûts de transaction et risque, jusqu'au déploiement et à la surveillance. Ce que la troisième édition ajoute, comme décrit dans le README : - Une boîte à outils de modèles plus large, incluant le boosting par gradient (XGBoost, LightGBM, CatBoost), les architectures profondes pour séries temporelles (PatchTST, iTransformer, TSMixer, TCN, Mamba), et des modèles tabulaires ou à facteurs latents tels que TabPFN, TabM, et des autoencodeurs conditionnels/supervisés. - Des chapitres dédiés aux coûts de transaction et à la gestion des risques, ainsi qu'à la construction de portefeuille et à la synthèse de stratégies. - Un volet production couvrant les systèmes de trading en direct (Interactive Brokers, Alpaca, QuantConnect), MLOps et des sujets de gouvernance tels que la détection de dérive, le déploiement sécurisé, les disjoncteurs, les magasins de caractéristiques et le suivi d'expériences. - Du matériel sur l'IA générative : génération augmentée par récupération basée sur les dépôts SEC, graphes de connaissances et Graph RAG, et systèmes de recherche multi-agents. - Apprentissage automatique causal (Double ML, séries temporelles structurelles bayésiennes, découverte causale), apprentissage par renforcement pour l'exécution, la tenue de marché et la couverture, et générateurs de données financières synthétiques (TimeGAN, Tail-GAN, Sig-CWGAN, méthodes basées sur la diffusion). Le README met l'accent sur la rigueur méthodologique : une frontière de preuve explicite entre exploration et confirmation, une validation croisée walk-forward, et des outils pour le contrôle des tests multiples et du surajustement tels que le ratio de Sharpe déflaté, le sérum anti-Rademacher, la vérification de réalité de White et la prédiction conforme. La couche de données utilise Polars, et les chapitres sont décrits comme étant fournis dans des environnements Docker reproductibles, avec PyTorch, LightGBM, Optuna et Plotly dans la pile de modélisation et de visualisation. Neuf études de cas traversent le livre, chacune menée à travers le même pipeline : ETF (quotidien, momentum et retour à la moyenne multi-actifs), perpétuels crypto (toutes les 8 heures, arbitrage de taux de financement), NASDAQ-100 (microstructure intrajournalière à 15 minutes), actions S&P 500 plus options (quotidien), caractéristiques d'entreprises américaines (mensuel), paires de devises (carry et momentum quotidiens), contrats à terme CME (structure par terme et rendement de roulement quotidiens), options S&P 500 (quotidien), et un large panel d'actions américaines (expositions factorielles quotidiennes). Les notebooks sont construits sur six bibliothèques Python compagnons, une par étape du flux de travail : ml4t-data pour l'acquisition de données de marché auprès de plusieurs fournisseurs, ml4t-engineer pour les caractéristiques, étiquettes, barres alternatives et préparation de jeux de données sans fuite, ml4t-models pour les facteurs latents natifs de la finance et l'apprentissage de portefeuille, ml4t-diagnostic pour la validation des caractéristiques, les diagnostics de stratégie et le ratio de Sharpe déflaté, ml4t-backtest pour le backtesting piloté par événements, et ml4t-live pour le trading en production avec des intégrations de courtiers. Le README indique que chacun est documenté et utilisable de manière autonome. Un site web compagnon est référencé pour 112 tutoriels gratuits, 61 compétences d'agents pour les agents de codage et les six bibliothèques. Le README liste également des cours payants, des ateliers et des sessions en direct gratuites, ainsi qu'un guide d'installation couvrant Linux, Windows WSL2, macOS, Docker et les configurations GPU. Les instructions de démarrage rapide offrent soit un environnement Docker Compose, soit un environnement local uv ; le chemin local compile plusieurs dépendances et nécessite un compilateur C/C++ et environ 16 Go d'espace disque. Les recommandations de plateforme suggèrent Docker sur macOS Intel et l'environnement local sur Apple Silicon, avec des raisons pour chacune. Ceci est un code éducatif et orienté recherche pour la finance quantitative et l'apprentissage automatique, pas un produit de trading packagé ; le README oriente explicitement les lecteurs vers un document décrivant ce que le dépôt est et n'est pas, y compris ce qui nécessite du calcul réel ou des données sous licence.