このプロジェクトについて

Stable Baselines3(SB3)は、PyTorchを使用して構築された信頼性の高い強化学習(RL)アルゴリズムの実装コレクションを提供します。これは、研究コミュニティや産業がアルゴリズムを一から実装することなく、RLアプローチを再現、改良、比較できる安定した基盤として機能します。 主な機能: - 共通のsklearnライクなインターフェースを持つ最先端のRL手法のサポート。 - カスタム環境、カスタムポリシー、カスタムコールバックのサポート。 - Dict観測空間とTensorboardによる監視への互換性。 - 高いコードカバレッジ、型ヒント、PEP8準拠。 - 実験追跡のためのWeights & Biases統合とモデル共有のためのHugging Face統合。 実装されているアルゴリズムには、A2C、ARS、DDPG、DQN、HER、PPO、SAC、TD3などがあります。一部の実験的機能(Recurrent PPOやTQCなど)はSB3-Contribリポジトリ経由で利用可能であり、パフォーマンス向上のためのJaxベース版(SBX)も利用可能です。 本プロジェクトはまた、一般的な環境に対するエージェントのトレーニング、評価、ハイパーパラメータチューニングのスクリプトを提供するトレーニングフレームワークであるRL Baselines3 Zooとも連携しています。