Sobre el proyecto

Este repositorio aloja el código que acompaña Machine Learning for Trading, 3.ª edición, de Stefan Jansen. Está organizado en torno a un único flujo de trabajo integral: definir una idea de investigación y desarrollarla iterativamente hasta convertirla en una estrategia que pueda ejecutarse y mantenerse en un mercado en vivo. El material abarca 27 capítulos y nueve casos de estudio, avanzando desde los datos brutos, pasando por características, modelos, backtests, costos de transacción y riesgo, hasta el despliegue y la monitorización. Lo que añade la tercera edición, según se describe en el README: - Un conjunto de modelos más amplio, que incluye gradient boosting (XGBoost, LightGBM, CatBoost), arquitecturas profundas de series temporales (PatchTST, iTransformer, TSMixer, TCN, Mamba) y modelos tabulares o de factores latentes como TabPFN, TabM y autoencoders condicionales/supervisados. - Capítulos dedicados a los costos de transacción y la gestión del riesgo, junto con la construcción de carteras y la síntesis de estrategias. - Un itinerario de producción que cubre sistemas de trading en vivo (Interactive Brokers, Alpaca, QuantConnect), temas de MLOps y gobernanza como la detección de deriva, el despliegue seguro, los disyuntores, los almacenes de características y el seguimiento de experimentos. - Material de IA generativa: generación aumentada por recuperación basada en presentaciones ante la SEC, grafos de conocimiento y Graph RAG, y sistemas de investigación multiagente. - Aprendizaje automático causal (Double ML, series temporales estructurales bayesianas, descubrimiento causal), aprendizaje por refuerzo para la ejecución, creación de mercado y cobertura, y generadores sintéticos de datos financieros (TimeGAN, Tail-GAN, Sig-CWGAN, métodos basados en difusión). El README enfatiza el rigor metodológico: una frontera de evidencia explícita entre exploración y confirmación, validación cruzada walk-forward y herramientas para el control de pruebas múltiples y sobreajuste, como el Deflated Sharpe Ratio, el Rademacher Anti-Serum, el Reality Check de White y la predicción conformal. La capa de datos utiliza Polars, y los capítulos se describen como distribuidos en entornos Docker reproducibles, con PyTorch, LightGBM, Optuna y Plotly en el stack de modelado y visualización. Nueve casos de estudio recorren el libro, cada uno llevado a través del mismo pipeline: ETFs (diario, momentum entre activos y reversión a la media), perpetuos de criptomonedas (cada 8 horas, arbitraje de tasas de financiación), NASDAQ-100 (microestructura intradía de 15 minutos), acciones del S&P 500 más opciones (diario), características de empresas estadounidenses (mensual), pares de divisas (carry y momentum diarios), futuros del CME (estructura temporal y roll yield diarios), opciones del S&P 500 (diario) y un panel amplio de acciones estadounidenses (exposiciones factoriales diarias). Los notebooks se construyen sobre seis bibliotecas Python complementarias, una por etapa del flujo de trabajo: ml4t-data para la adquisición de datos de mercado de múltiples proveedores, ml4t-engineer para características, etiquetas, barras alternativas y preparación de conjuntos de datos a prueba de fugas, ml4t-models para factores latentes nativos de finanzas y aprendizaje de carteras, ml4t-diagnostic para la validación de características, diagnósticos de estrategias y el Deflated Sharpe Ratio, ml4t-backtest para backtesting dirigido por eventos, y ml4t-live para trading en producción con integraciones de brókeres. El README indica que cada una está documentada y puede usarse de forma independiente. Se referencia un sitio web complementario con 112 introducciones gratuitas, 61 habilidades de agente para agentes de codificación y las seis bibliotecas. El README también enumera cursos de pago, talleres y sesiones en vivo gratuitas, además de una guía de instalación que cubre Linux, Windows WSL2, macOS, Docker y configuraciones con GPU. Las instrucciones de inicio rápido ofrecen un entorno Docker Compose o un entorno local con uv; la ruta local compila varias dependencias y se indica que requiere un compilador de C/C++ y aproximadamente 16 GB de disco. La guía de plataformas recomienda Docker en macOS con Intel y el entorno local en Apple Silicon, con razones para cada caso. Este es código educativo y orientado a la investigación para finanzas cuantitativas y aprendizaje automático, no un producto de trading empaquetado; el README remite explícitamente a los lectores a un documento que describe qué es y qué no es el repositorio, incluido lo que requiere cómputo real o datos con licencia.