프로젝트 소개

Stable Baselines3(SB3)는 PyTorch를 기반으로 구축된 신뢰할 수 있는 강화학습(RL) 알고리즘 구현체를 제공합니다. 이 프로젝트는 연구 커뮤니티와 산업界가 강화학습 접근법을 처음부터 구현하지 않고도 복제, 개선 및 비교할 수 있는 안정적인 기반을 목표로 합니다. 주요 기능은 다음과 같습니다: - sklearn과 유사한 공통 인터페이스를 갖춘 최신 상태의 RL 방법론 지원. - 사용자 지정 환경, 정책 및 콜백 지원. - Dict 관찰 공간 및 모니터링을 위한 Tensorboard 호환성. - 높은 코드 커버리지, 타입 힌트 및 PEP8 준수. - 실험 추적을 위한 Weights & Biases 통합 및 모델 공유를 위한 Hugging Face 호환성. 구현된 알고리즘에는 A2C, ARS, DDPG, DQN, HER, PPO, SAC, TD3 등이 포함됩니다. 일부 실험적 기능(예: Recurrent PPO 및 TQC)은 SB3-Contrib 저장소를 통해 사용할 수 있으며, 성능 향상을 위해 Jax 기반 버전인 SBX도 제공됩니다. 이 프로젝트는 일반적인 환경에서 에이전트 훈련, 평가 및 하이퍼파라미터 튜닝을 위한 스크립트를 제공하는 훈련 프레임워크인 RL Baselines3 Zoo와도 연동됩니다.