프로젝트 소개

decisionrl은 가격 책정, 재고 관리, 에너지 디스패치, 대기열 수락, 공급망 최적화와 같은 운영 의사결정 문제를 위해 특별히 설계된 강화학습 라이브러리입니다. 게임과 로봇 공학을 대상으로 하는 범용 RL 프레임워크와 달리, decisionrl은 각 응용 문제를 일급 환경으로 제공하고 고전적인 운영 연구 기준선과 함께 제공하여 학습된 정책이 단순히 좋다고 주장하는 대신 표준 방법과 비교하여 측정될 수 있도록 합니다. 이 라이브러리는 표 형식 방법(Q-Learning, SARSA, Expected SARSA, Dyna-Q), 가치 기반 심층 RL(DQN, Rainbow, C51, QR-DQN), 행위자-비평가 방법(PPO, A2C, TRPO, GRPO, IMPALA, Recurrent PPO), 연속 제어(DDPG, TD3, SAC, SACDiscrete), 오프라인 RL(TD3+BC, IQL, CQL, Decision Transformer), 모델 기반 접근법(MBPO, Dreamer, DreamerRSSM), 목표 조건 학습(HER+DQN), 모방 학습(Diffusion Policy)을 포함한 31개의 알고리즘을 제공합니다. 모든 에이전트는 표 형식이든 심층이든, 이산적이든 연속적이든, 온-폴리시든 오프-폴리시든 관계없이 통합된 predict/learn/save/load 인터페이스를 노출합니다. 핵심은 의존성이 가볍습니다: 환경, 고전적 기준선, 솔버는 순수 NumPy로 구현되며, PyTorch는 학습하는 알고리즘에만 필요한 선택적 추가 기능입니다. 내장 환경에는 GridWorld, CartPole, Pendulum, PointMass, 밴딧이 포함되어 추가 설치 없이 종단 간 학습이 가능합니다. Gymnasium 환경은 선택적 추가 기능으로 제공됩니다. 응용 환경은 수요가 변동하는 비정상 재고, 2계층 공급망, 대기열 수락 제어, 에너지 마이크로그리드 배터리 관리, 온도조절기/HVAC 제어, 정상 재고, 동적 가격 책정, 가격 및 재고 결합을 포함합니다. 각 환경에는 단순한 기본값이 아닌 검색으로 찾은 최상의 고정 규칙 고전적 기준선이 포함됩니다. 결과는 학습된 정책이 비정상 작업에서 고전적 기준선을 능가하며(예: 변동 재고에서 약 16% 개선, 에너지 마이크로그리드에서 20%, 공급망 비용 절감에서 15%), 정상 작업에서는 정확한 동적 프로그래밍 최적값과 일치함을 보여줍니다. 사례 연구는 1959년부터 2009년까지의 분기별 미국 실소비 데이터로 재고 환경을 구동하여, 실제 수요 추세로 인해 단일 주문-상한 수준이 모든 시대에 맞지 않으므로 학습된 정책이 최상의 고정 기준 재고보다 개선됨을 보여줍니다. 라이브러리에는 가격 책정 및 추천과 같은 일회성 결정을 위한 컨텍스트 밴딧(LinUCB, 선형 톰슨 샘플링, 엡실론-그리디), 제어 작업 및 문자 수준 GPT에 대한 RLHF 및 DPO, 모방 학습(BC, DAgger, GAIL), 호기심 기반 탐험(RND, ICM), 그라디언트 없는 최적화(ask/tell 인터페이스와 NeuroevolutionAgent를 포함한 12가지 진화 및 군집 방법), 2인 완전 정보 게임을 위한 MCTS 및 자가 대국을 갖춘 AlphaZero, 작업 분포에 걸친 온라인 적응을 위한 메타-RL(RL²), IPPO를 사용한 다중 에이전트 자가 대국, 중앙 V-trace 학습자에 공급하는 분산 IMPALA 스타일 행위자, ONNX 및 TorchScript 내보내기와 torch-free FastAPI 서빙 컨테이너도 포함합니다. 명령줄 인터페이스는 학습, 평가, 실시간 대시보드 시각화를 지원합니다. 실험은 YAML 또는 JSON으로 선언하고 decisionrl run 또는 decisionrl.config.run으로 실행할 수 있습니다. 재현성은 Python, NumPy, PyTorch 전반에 걸친 시드 가능한 RNG로 보장되며, 400개 이상의 테스트 스위트가 구성 요소 정확성(공간, 버퍼, 합계 트리, 스케줄, GAE, 정규화, 저장/로드 왕복)과 학습 동작(표 형식 방법이 최적 GridWorld 정책에 도달, DQN 및 PPO가 CartPole 학습, SAC, TD3, DDPG가 PointMass 작업 해결)을 다룹니다. 예약된 CI 워크플로는 매일 다중 시드 응용 검증을 재실행하고 보고된 결과가 기준선 아래로 회귀하면 실패합니다. 이 프로젝트는 MIT 라이선스로 제공되며 CleanRL, Stable-Baselines3, Tianshou, Farama 재단의 Gymnasium 인터페이스에서 디자인 영감을 얻었습니다.