Sobre o projeto

O Stable Baselines3 (SB3) oferece uma coleção de implementações confiáveis de algoritmos de reinforcement learning (RL) construídas com PyTorch. Ele serve como uma base estável para a comunidade de pesquisa e a indústria replicarem, refinarem e compararem abordagens de RL sem precisar implementar algoritmos do zero. Os principais recursos incluem: - Suporte a métodos de RL state-of-the-art com uma interface comum, semelhante ao sklearn. - Suporte a ambientes customizados, políticas customizadas e callbacks customizados. - Compatibilidade com espaços de observação Dict e Tensorboard para monitoramento. - Alta cobertura de código, type hints e conformidade com PEP8. - Integração com Weights & Biases para rastreamento de experimentos e com o Hugging Face para compartilhamento de modelos. Os algoritmos implementados incluem A2C, ARS, DDPG, DQN, HER, PPO, SAC, TD3 e outros. Alguns recursos experimentais (como Recurrent PPO e TQC) estão disponíveis por meio do repositório SB3-Contrib, enquanto uma versão baseada em Jax (SBX) está disponível para maior desempenho. O projeto também se conecta ao RL Baselines3 Zoo, um framework de treinamento que fornece scripts para treinar, avaliar agentes e ajustar hiperparâmetros para ambientes comuns.