Sobre o projeto
O Stable Baselines3 (SB3) oferece uma coleção de implementações confiáveis de algoritmos de reinforcement learning (RL) construídas com PyTorch. Ele serve como uma base estável para a comunidade de pesquisa e a indústria replicarem, refinarem e compararem abordagens de RL sem precisar implementar algoritmos do zero.
Os principais recursos incluem:
- Suporte a métodos de RL state-of-the-art com uma interface comum, semelhante ao sklearn.
- Suporte a ambientes customizados, políticas customizadas e callbacks customizados.
- Compatibilidade com espaços de observação Dict e Tensorboard para monitoramento.
- Alta cobertura de código, type hints e conformidade com PEP8.
- Integração com Weights & Biases para rastreamento de experimentos e com o Hugging Face para compartilhamento de modelos.
Os algoritmos implementados incluem A2C, ARS, DDPG, DQN, HER, PPO, SAC, TD3 e outros. Alguns recursos experimentais (como Recurrent PPO e TQC) estão disponíveis por meio do repositório SB3-Contrib, enquanto uma versão baseada em Jax (SBX) está disponível para maior desempenho.
O projeto também se conecta ao RL Baselines3 Zoo, um framework de treinamento que fornece scripts para treinar, avaliar agentes e ajustar hiperparâmetros para ambientes comuns.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.