Об этом проекте
Stable Baselines3 (SB3) предоставляет набор надёжных реализаций алгоритмов обучения с подкреплением (RL), созданных на базе PyTorch. Он служит стабильной основой для исследовательского сообщества и индустрии, позволяя воспроизводить, дорабатывать и сравнивать подходы RL без необходимости реализации алгоритмов с нуля.
Ключевые особенности:
- Поддержка методов RL класса state-of-the-art со стандартным интерфейсом, похожим на sklearn.
- Поддержка пользовательских окружений, пользовательских политик и пользовательских callback-ов.
- Совместимость с Dict-пространствами наблюдений и Tensorboard для мониторинга.
- Высокое покрытие кода тестами, типизация и соответствие PEP8.
- Интеграция с Weights & Biases для отслеживания экспериментов и Hugging Face для обмена моделями.
Реализованные алгоритмы включают A2C, ARS, DDPG, DQN, HER, PPO, SAC, TD3 и другие. Некоторые экспериментальные возможности (такие как Recurrent PPO и TQC) доступны через репозиторий SB3-Contrib, а версия на Jax (SBX) доступна для повышения производительности.
Проект также связан с RL Baselines3 Zoo — фреймворком для тренировки, который предоставляет скрипты для тренировки агентов, их оценки и настройки гиперпараметров для распространённых окружений.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.