Об этом проекте

Stable Baselines3 (SB3) предоставляет набор надёжных реализаций алгоритмов обучения с подкреплением (RL), созданных на базе PyTorch. Он служит стабильной основой для исследовательского сообщества и индустрии, позволяя воспроизводить, дорабатывать и сравнивать подходы RL без необходимости реализации алгоритмов с нуля. Ключевые особенности: - Поддержка методов RL класса state-of-the-art со стандартным интерфейсом, похожим на sklearn. - Поддержка пользовательских окружений, пользовательских политик и пользовательских callback-ов. - Совместимость с Dict-пространствами наблюдений и Tensorboard для мониторинга. - Высокое покрытие кода тестами, типизация и соответствие PEP8. - Интеграция с Weights & Biases для отслеживания экспериментов и Hugging Face для обмена моделями. Реализованные алгоритмы включают A2C, ARS, DDPG, DQN, HER, PPO, SAC, TD3 и другие. Некоторые экспериментальные возможности (такие как Recurrent PPO и TQC) доступны через репозиторий SB3-Contrib, а версия на Jax (SBX) доступна для повышения производительности. Проект также связан с RL Baselines3 Zoo — фреймворком для тренировки, который предоставляет скрипты для тренировки агентов, их оценки и настройки гиперпараметров для распространённых окружений.