Sobre el proyecto
Stable Baselines3 (SB3) proporciona una colección de implementaciones confiables de algoritmos de aprendizaje por refuerzo (RL) construidas con PyTorch. Sirve como una base estable para que la comunidad académica y la industria repliquen, perfeccionen y comparen enfoques de RL sin necesidad de implementar algoritmos desde cero.
Las características principales incluyen:
- Soporte para métodos de RL de vanguardia con una interfaz común similar a sklearn.
- Soporte para entornos personalizados, políticas personalizadas y callbacks personalizados.
- Compatibilidad con espacios de observación Dict y Tensorboard para monitoreo.
- Alta cobertura de código, anotaciones de tipos y cumplimiento de PEP8.
- Integración con Weights & Biases para seguimiento de experimentos y Hugging Face para compartir modelos.
Los algoritmos implementados incluyen A2C, ARS, DDPG, DQN, HER, PPO, SAC, TD3 y otros. Algunas funciones experimentales (como Recurrent PPO y TQC) están disponibles a través del repositorio SB3-Contrib, mientras que una versión basada en Jax (SBX) está disponible para mayor rendimiento.
El proyecto también se vincula con RL Baselines3 Zoo, un marco de entrenamiento que proporciona scripts para entrenar, evaluar agentes y ajustar hiperparámetros para entornos comunes.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.