Об этом проекте

Этот репозиторий содержит код, сопровождающий книгу Machine Learning for Trading, 3-е издание, автора Стефана Янсена. Он организован вокруг единого сквозного рабочего процесса: определение исследовательской идеи и ее итеративная разработка в стратегию, которую можно запускать и поддерживать на живом рынке. Материал охватывает 27 глав и девять тематических исследований, переходя от сырых данных через признаки, модели, бэктесты, транзакционные издержки и риск к развертыванию и мониторингу. Что добавляет третье издание, как описано в README: - Более широкий набор моделей, включая градиентный бустинг (XGBoost, LightGBM, CatBoost), глубокие архитектуры для временных рядов (PatchTST, iTransformer, TSMixer, TCN, Mamba), а также табличные или латентно-факторные модели, такие как TabPFN, TabM и условные/контролируемые автоэнкодеры. - Отдельные главы о транзакционных издержках и управлении рисками, наряду с построением портфеля и синтезом стратегий. - Производственный трек, охватывающий системы live-торговли (Interactive Brokers, Alpaca, QuantConnect), MLOps и вопросы управления, такие как обнаружение дрейфа, безопасный rollout, предохранители, хранилища признаков и отслеживание экспериментов. - Материалы по генеративному ИИ: генерация с дополнением поиском на основе документов SEC, графы знаний и Graph RAG, а также мультиагентные исследовательские системы. - Причинно-следственное машинное обучение (Double ML, байесовские структурные временные ряды, обнаружение причинно-следственных связей), обучение с подкреплением для исполнения, маркет-мейкинга и хеджирования, а также генераторы синтетических финансовых данных (TimeGAN, Tail-GAN, Sig-CWGAN, методы на основе диффузии). В README подчеркивается методологическая строгость: явная граница доказательств между исследованием и подтверждением, скользящая кросс-валидация с расширением окна, а также инструменты для контроля множественного тестирования и переобучения, такие как Deflated Sharpe Ratio, Rademacher Anti-Serum, White's Reality Check и конформное прогнозирование. Уровень данных использует Polars, а главы описаны как поставляемые в воспроизводимых Docker-средах, со стеком моделирования и визуализации на PyTorch, LightGBM, Optuna и Plotly. В книге представлены девять тематических исследований, каждое из которых проходит через один и тот же конвейер: ETF (ежедневно, кросс-активная импульсная и средняя реверсия), крипто-перпетуалы (8-часовые, арбитраж ставок финансирования), NASDAQ-100 (15-минутная внутридневная микроструктура), акции S&P 500 плюс опционы (ежедневно), характеристики фирм США (ежемесячно), валютные пары (ежедневный керри и импульс), фьючерсы CME (ежедневная временная структура и доходность от ролловера), опционы на S&P 500 (ежедневно) и широкая панель акций США (ежедневные факторные экспозиции). Ноутбуки построены на шести сопутствующих Python-библиотеках, по одной на каждый этап рабочего процесса: ml4t-data для получения рыночных данных от нескольких провайдеров, ml4t-engineer для признаков, меток, альтернативных баров и подготовки наборов данных без утечек, ml4t-models для финансовых латентных факторов и обучения портфеля, ml4t-diagnostic для валидации признаков, диагностики стратегий и Deflated Sharpe Ratio, ml4t-backtest для событийного бэктестинга и ml4t-live для производственной торговли с интеграциями брокеров. В README указано, что каждая библиотека документирована и может использоваться самостоятельно. Упоминается сопутствующий веб-сайт со 112 бесплатными вводными материалами, 61 навыком агента для кодирующих агентов и шестью библиотеками. В README также перечислены платные курсы, воркшопы и бесплатные живые сессии, а также руководство по установке, охватывающее Linux, Windows WSL2, macOS, Docker и настройки GPU. Инструкции по быстрому старту предлагают либо среду Docker Compose, либо локальную среду uv; локальный путь компилирует несколько зависимостей и, как отмечается, требует компилятора C/C++ и примерно 16 ГБ дискового пространства. Рекомендации по платформам рекомендуют Docker на Intel macOS и локальную среду на Apple Silicon, с указанием причин для каждого варианта. Это образовательный и исследовательский код для количественных финансов и машинного обучения, а не готовый торговый продукт; в README явно указано на документ, описывающий, чем репозиторий является и не является, включая то, что требует реальных вычислений или лицензированных данных.