Sobre o projeto

Este repositório hospeda o código que acompanha Machine Learning for Trading, 3ª Edição, de Stefan Jansen. Ele está organizado em torno de um único fluxo de trabalho de ponta a ponta: definir uma ideia de pesquisa e desenvolvê-la iterativamente até se tornar uma estratégia que possa ser executada e mantida em um mercado ao vivo. O material abrange 27 capítulos e nove estudos de caso, partindo de dados brutos, passando por features, modelos, backtests, custos de transação e risco, até implantação e monitoramento. O que a terceira edição acrescenta, conforme descrito no README: - Um conjunto de ferramentas de modelagem mais amplo, incluindo gradient boosting (XGBoost, LightGBM, CatBoost), arquiteturas profundas de séries temporais (PatchTST, iTransformer, TSMixer, TCN, Mamba) e modelos tabulares ou de fatores latentes, como TabPFN, TabM e autoencoders condicionais/supervisionados. - Capítulos dedicados a custos de transação e gestão de risco, além de construção de portfólio e síntese de estratégias. - Uma trilha de produção cobrindo sistemas de negociação ao vivo (Interactive Brokers, Alpaca, QuantConnect), tópicos de MLOps e governança, como detecção de drift, implantação segura, circuit breakers, feature stores e rastreamento de experimentos. - Material de IA generativa: geração aumentada por recuperação baseada em documentos da SEC, grafos de conhecimento e Graph RAG, e sistemas de pesquisa multiagente. - Aprendizado de máquina causal (Double ML, séries temporais estruturais bayesianas, descoberta causal), aprendizado por reforço para execução, formação de mercado e hedge, e geradores sintéticos de dados financeiros (TimeGAN, Tail-GAN, Sig-CWGAN, métodos baseados em difusão). O README enfatiza rigor metodológico: uma fronteira explícita de evidência entre exploração e confirmação, validação cruzada walk-forward e ferramentas para controle de múltiplos testes e overfitting, como o Deflated Sharpe Ratio, o Rademacher Anti-Serum, o White's Reality Check e a predição conformal. A camada de dados usa Polars, e os capítulos são descritos como entregues em ambientes Docker reproduzíveis, com PyTorch, LightGBM, Optuna e Plotly na stack de modelagem e visualização. Nove estudos de caso percorrem o livro, cada um conduzido pelo mesmo pipeline: ETFs (diário, momentum e reversão à média entre ativos), perpétuos de criptomoedas (a cada 8 horas, arbitragem de taxa de financiamento), NASDAQ-100 (microestrutura intradiária de 15 minutos), ações do S&P 500 mais opções (diário), características de empresas dos EUA (mensal), pares de FX (carry e momentum diários), futuros da CME (estrutura a termo e roll yield diários), opções do S&P 500 (diário) e um amplo painel de ações dos EUA (exposições a fatores diárias). Os notebooks são construídos sobre seis bibliotecas Python complementares, uma por estágio do fluxo de trabalho: ml4t-data para aquisição de dados de mercado de múltiplos provedores, ml4t-engineer para features, rótulos, barras alternativas e preparação de conjuntos de dados à prova de vazamento, ml4t-models para fatores latentes nativos de finanças e aprendizado de portfólio, ml4t-diagnostic para validação de features, diagnósticos de estratégia e o Deflated Sharpe Ratio, ml4t-backtest para backtesting orientado a eventos e ml4t-live para negociação em produção com integrações de corretoras. O README afirma que cada uma é documentada e utilizável de forma independente. Um site complementar é referenciado para 112 primers gratuitos, 61 habilidades de agente para agentes de codificação e as seis bibliotecas. O README também lista cursos pagos, workshops e sessões ao vivo gratuitas, além de um guia de instalação cobrindo Linux, Windows WSL2, macOS, Docker e configurações com GPU. As instruções de início rápido oferecem um ambiente Docker Compose ou um ambiente local com uv; o caminho local compila várias dependências e é indicado como exigindo um compilador C/C++ e cerca de 16 GB de disco. A orientação por plataforma recomenda Docker no macOS Intel e o ambiente local no Apple Silicon, com razões apresentadas para cada caso. Este é um código educacional e voltado à pesquisa em finanças quantitativas e aprendizado de máquina, não um produto de negociação empacotado; o README aponta explicitamente os leitores para um documento que descreve o que o repositório é e o que não é, incluindo o que exige computação real ou dados licenciados.