排序: 最新 热门 引用
cs.LG 2510.01132

A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning

本研究提出多轮强化学习(RL)训练大规模语言模型(LLM)代理的系统框架,强调环境、奖励和策略三大支柱,实证验证在TextWorld、ALFWorld和SWE-Gym中的有效性。

Ruiyi Wang, Prithviraj Ammanabrolu

2025-10-02 63