Sobre o projeto
TorchRL é uma biblioteca PyTorch modular, primitiva-primeiro e Python-primeiro para aprendizado por reforço. Ela fornece blocos de construção componíveis para sistemas de RL em vez de uma única implementação de algoritmo, mantendo o código próximo ao modelo de programação do PyTorch. A biblioteca é organizada em torno do TensorDict, um contêiner de tensores semelhante a um dicionário que preserva campos nomeados, estrutura, dimensões de lote e dispositivos ao longo do ciclo de treinamento.
Os componentes principais incluem ambientes e transformações (com wrappers para Gymnasium, DM Control, Brax, PettingZoo, VMAS, Isaac Lab e outros), coletores para execução em processo único, assíncrona, multiprocesso e distribuída, buffers de replay com armazenamento priorizado e com suporte a memmap, módulos de política com chaves de entrada/saída explícitas e módulos de perda cobrindo PPO, SAC, DQN, TD3, REDQ, IQL, CQL, Decision Transformer, Dreamer, MAPPO, IPPO, QMIX/VDN e mais. A biblioteca também suporta fluxos de trabalho multiagente, baseados em modelo, aprendizado por imitação e pós-treinamento de LLM, incluindo objetivos GRPO e SFT.
O TorchRL 0.13 adiciona caminhos mais rápidos de RL recorrente com backends Triton e scan, ambientes MuJoCo personalizados, utilitários de normalização de valor multiagente, buffers de replay HER e ergonomia aprimorada de coletores e buffers de replay. A instalação está disponível via PyPI com extras opcionais para Gymnasium, Atari, dados offline, ambientes multiagente e backends de LLM.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.