这个项目能做什么

TorchRL 是一个模块化、原语优先、Python 优先的 PyTorch 强化学习库。它提供用于 RL 系统的可组合构建块,而不是单一算法实现,使代码贴近 PyTorch 编程模型。该库围绕 TensorDict 组织,这是一种类似字典的张量容器,在整个训练循环中保留命名字段、结构、批次维度和设备。 关键组件包括环境与变换(带有 Gymnasium、DM Control、Brax、PettingZoo、VMAS、Isaac Lab 等的包装器)、用于单进程、异步、多进程和分布式执行的收集器、支持优先采样和 memmap 存储的回放缓冲区、具有显式输入/输出键的策略模块,以及涵盖 PPO、SAC、DQN、TD3、REDQ、IQL、CQL、Decision Transformer、Dreamer、MAPPO、IPPO、QMIX/VDN 等的损失模块。该库还支持多智能体、基于模型、模仿学习以及 LLM 后训练工作流,包括 GRPO 和 SFT 目标。 TorchRL 0.13 增加了使用 Triton 和 scan 后端的更快的循环 RL 路径、自定义 MuJoCo 环境、多智能体价值归一化工具、HER 回放缓冲区,以及改进的收集器和回放缓冲区易用性。可通过 PyPI 安装,并提供针对 Gymnasium、Atari、离线数据、多智能体环境和 LLM 后端的可选附加项。