RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning

TL;DR

StarPO与StarPO-S揭示多轮智能体RL的Echo Trap;FrozenLake筛选可将稳定期由100步延至140步。

cs.LG 🔴 高级 2025-04-25 27 次浏览
Zihan Wang Kangrui Wang Qineng Wang Pingyue Zhang Linjie Li Zhengyuan Yang Xing Jin Kefan Yu Minh Nhat Nguyen Licheng Liu Eli Gottlieb Yiping Lu Kyunghyun Cho Jiajun Wu Li Fei-Fei Lijuan Wang Yejin Choi Manling Li
大语言模型智能体 多轮强化学习 StarPO Echo Trap 轨迹优化

核心发现

方法论

论文提出StarPO,将状态、思考、动作与奖励组成完整轨迹,以最大化J(θ)=E[R(τ)];兼容PPO与GRPO。RAGEN提供可插拔环境、奖励和rollout系统;StarPO-S进一步加入基于奖励方差的轨迹筛选、critic基线、KL移除与Clip-Higher梯度整形。

关键结果

  • 在Bandit、Sokoban、Frozen Lake中,普通PPO/GRPO先提升后坍塌;FrozenLake-PPO的奖励标准差约第40步骤降,平均奖励约第90步才崩溃,Bandit与Sokoban的梯度峰值分别约在170和110步。
  • StarPO-S保留高不确定性样本:FrozenLake-PPO保留75%轨迹可将稳定期由100延至140步,保留50%几乎避免坍塌;默认保留25%。Online-1比Online-5/10收集更新鲜轨迹,收敛和泛化更好。
  • rollout设计显著影响泛化:每提示4次响应在SokobanNewVocab达25.39%、FrozenLake达21.48%;每轮6动作时Sokoban为33.59%、LargeSokoban为6.64%,优于1动作的12.11%和1.17%。

研究意义

研究把多轮交互中的训练崩溃从一般的性能下降,具体化为可监测的Echo Trap:探索熵与奖励方差先收缩,梯度随后尖峰化。它说明单轮PPO或GRPO不能直接解决长期、随机反馈下的智能体学习,为机器人、网页代理和教育助手提供了更可靠的实验框架,也提醒业界不能把格式化思考等同于真实推理。

技术贡献

StarPO统一了token级自回归策略与轨迹级奖励:a_t^T=<think>...</think><answer>a_t</answer>,并用PPO优势或GRPO归一化奖励更新全轨迹token。StarPO-S将主动学习式不确定性U=Std[R(τ)]用于prompt筛选,同时采用critic、KL Term Removal和非对称Clip-Higher,形成面向多轮RL的采样与梯度稳定机制。

新颖性

核心新意不是提出新的单轮目标,而是系统刻画多轮LLM代理的自演化动力学。论文提出Echo Trap这一失稳模式,并把轨迹多样性、交互粒度、在线频率与奖励可解释性放在同一框架内比较,连接了主动采样、PPO/GRPO和代理推理训练。

局限性

  • 实验主体使用Qwen-2.5-Instruct 0.5B,WebShop使用3B,环境仍以Bandit、Sokoban、Frozen Lake等受控任务为主,结论对真实网页、机器人和超长任务的外推尚未充分验证。
  • 奖励主要来自任务成功与规则反馈;论文显示仅要求<think>格式会产生浅层或幻觉式思考,因此尚未解决可验证、细粒度、推理感知奖励的构造问题。

未来方向

未来应在真实工具链和长时域任务中验证StarPO-S,研究自适应筛选比例、分层GAE与response mask,并设计同时评价状态一致性、因果规划和最终成功的细粒度奖励;还需测试更大模型、离线回放和跨环境迁移。

AI 总览摘要

让语言模型成为真正的智能体,难点不只是生成一个正确答案,而是在多轮互动中记忆状态、连续决策,并承受环境的随机反馈。论文指出,直接把单轮PPO或GRPO搬到智能体任务上,往往只能带来短暂提升:模型随后重复局部有效的语言模板,探索性下降,最终性能崩溃。

研究者提出StarPO(State-Thinking-Actions-Reward Policy Optimization)与RAGEN系统。StarPO把思考、可执行动作、环境状态和反馈视为一条完整轨迹,以轨迹总奖励训练模型;RAGEN则提供Bandit、Sokoban、Frozen Lake和WebShop等模块化环境。针对反复自我强化的Echo Trap,StarPO-S按照重复rollout的奖励标准差筛选高信息样本,并结合critic、KL移除和Clip-Higher稳定梯度。

实验显示,FrozenLake-PPO的奖励方差约第40步先坍缩,平均奖励约第90步才下降;梯度峰值通常预示难以恢复的崩溃。StarPO-S在Frozen Lake中将稳定期从100步延至140步。轨迹质量同样关键:4次响应/提示在SokobanNewVocab达到25.39%,6动作/轮使Sokoban达到33.59%;Online-1新鲜采样优于Online-5/10。研究的更深层结论是:没有细粒度、推理感知奖励,模型即使输出思考,也未必真正推理。

深度分析

研究背景

传统LLM强化学习多针对数学和代码等单轮任务,PPO与GRPO通常优化一次输入—输出的奖励。代理任务则包含状态记忆、动作序列和随机转移。RAGEN用三个可控符号环境及WebShop连接单轮RL与真实交互,研究模型如何通过经验自我改进。

核心问题

多轮轨迹带来信用分配、长时域探索、策略—数据失配和随机反馈问题。单一终局奖励无法说明哪段思考有效;模型还可能因重复成功模板而失去多样性,出现奖励方差下降、熵异常和梯度爆炸。

核心创新

  • ��StarPO:以J=E[R(τ)]优化完整思考—行动轨迹,而非独立回答。•StarPO-S:以U=Std[R(τ)]筛选高不确定性prompt,并结合critic、KL移除和Clip-Higher。•系统研究发现:多样初始状态、每轮5—6动作、Online-1新鲜采样更有利于学习。

方法详解

  • ��模型在状态s_t和历史τ_<t条件下生成a_t^T=<think>...</think><answer>a_t</answer>。•环境返回r_t与s_{t+1},最多5轮、每轮最多10动作。•每次使用P=8个prompt、N=16条轨迹;通过PPO+GAE(γ=λ=1)或GRPO更新。•StarPO-S按重复rollout奖励标准差保留高不确定性样本,默认保留25%,并使用Adam、熵系数0.001及格式惩罚−0.1。

实验设计

训练Qwen-2.5-Instruct 0.5B完成三个符号任务,WebShop使用3B;在H100上训练100—200次rollout-update。验证集含256个固定prompt,温度0.5,最多5轮。指标包括成功率、rollout熵、组内奖励标准差、响应长度和梯度范数,并比较PPO、GRPO、StarPO-S及Online-1/5/10。

结果分析

普通方法在Bandit、Sokoban早期提升后坍塌;PPO通常比GRPO稳定,但Frozen Lake因价值难估计而更适合GRPO。FrozenLake-PPO方差第40步、均值第90步下降。StarPO-S把稳定期从100延至140步;Sokoban每轮6动作成功率33.59%,4响应/提示使SokobanNewVocab达25.39%。

应用场景

可用于网页购物代理、工具调用助手、教育辅导和机器人规划。实际部署应先记录奖励方差、熵与梯度范数,再用多初始状态、适中动作预算和新鲜rollout训练;若奖励只衡量最终成功,则不应把模型输出的思考直接视为可信解释。

局限与展望

任务规模和模型规模有限,WebShop虽更真实但仍不是开放世界。奖励设计仍是瓶颈,无法充分区分真实规划与事后编造。高频在线采样和多轨迹比较增加计算成本;25%筛选比例并非普适最优。未来需评估72B及前沿模型、真实工具环境、长时域信用分配和可验证推理奖励。

通俗解读 非专业人士也能看懂

把模型想成一支在陌生城市送货的快递队。每名快递员先看地图、想路线,再开车;城市会给出成功、绕路或失败的反馈。普通训练容易让所有人反复照抄一条曾经成功的路线:开始时效率提高,后来遇到新街区就集体迷路,这就是论文所说的Echo Trap。

StarPO像一本完整的行车日志,不只记录最后是否送达,还记录每次观察、想法、动作和反馈。StarPO-S则优先保留那些不同快递员结果差异较大的街区,因为这些地方最能提供新信息;同时限制方向变化过猛,避免训练一次就把路线系统弄坏。

实验说明,起点越多、每次允许适量连续动作、越快收集最新路线,学习越可靠。但如果只奖励“送到了”,快递员可能写出听起来合理却与实际路线无关的说明。因此,真正好的训练还要检查每一步是否看懂环境、计划是否帮助完成任务。

简单解释 像给14岁少年讲一样

想象你在玩一个会变化的迷宫游戏。你每走一步都要观察地图、想策略、按按钮,游戏再告诉你走得好不好。普通方法像只看最后有没有通关:如果偶然成功,就让你以后一直照抄那套操作。短期看起来变强,遇到不同地图却马上翻车,这就是Echo Trap。

StarPO会把整局游戏保存下来:看到什么、脑中怎么想、做了什么、得到多少分,全都一起学习。StarPO-S还会挑选“结果最不稳定”的地图训练,因为这些地图最有机会让你学到新东西;它也避免分数变化太突然导致模型崩坏。

论文测试了Bandit、Sokoban、Frozen Lake和WebShop。FrozenLake训练中,奖励变化在约第40步就明显变小,平均成绩约第90步才下降;筛选轨迹后,稳定时间从100步延长到140步。Sokoban每轮允许6个动作时成绩为33.59%。

最有趣的是,模型写出“思考”不代表它真的思考。如果奖励只看最终胜负,它可能生成漂亮但胡编的解释。所以未来的AI老师、游戏助手或机器人,不仅要看结果,还要检查每一步是否理解了当时的情况。

术语表

StarPO(State-Thinking-Actions-Reward Policy Optimization)

面向多轮代理的轨迹级策略优化框架,把思考、动作、状态和奖励作为整体训练。其目标是最大化完整轨迹的累计奖励。

论文的核心方法,兼容PPO和GRPO。

StarPO-S(Stabilized StarPO)

StarPO的稳定版本,通过奖励方差筛选、critic基线和梯度整形减少训练崩溃。它默认保留约25%的高不确定性prompt。

用于缓解Echo Trap。

Echo Trap(回声陷阱)

模型过度重复局部有效模板,导致奖励方差、熵和行为多样性下降,随后出现梯度尖峰与性能坍塌。它类似自我生成数据造成的模式回声。

论文发现的多轮RL特有失稳模式。

GRPO(Group Relative Policy Optimization)

无需critic的策略优化方法,以组内轨迹奖励的均值和标准差归一化优势。公式为Â=(R−mean(R))/std(R)。

与PPO进行跨环境比较。

轨迹不确定性(Trajectory uncertainty)

同一初始状态多次rollout所得奖励的标准差U=Std[R(τ)]。标准差高表示策略结果更不确定、信息量可能更大。

StarPO-S的筛选依据。

Online-k rollout

同一批轨迹连续用于k次策略更新;k越小,采样越新。Online-1表示每次更新都重新采样。

用于研究策略—数据新鲜度。

开放问题 这项研究留下的未解疑问

  • 1 如何构造真正细粒度且推理感知的奖励,既验证中间状态与计划,又避免奖励模型被表面语言欺骗,论文尚未给出通用解法。
  • 2 StarPO-S在真实网页、机器人和超长任务中的稳定性、成本与跨环境迁移仍未知;需要更大规模、长期在线实验。

应用场景

近期应用

网页购物代理训练

开发者可用WebShop式环境训练多轮搜索与决策代理,采用Online-1、多个初始状态和奖励方差监控,降低策略重复与性能突然坍塌;前提是工具反馈可记录且任务奖励可验证。

工具调用与教育助手

将调用链保存为轨迹,并分别评价状态理解、工具选择和最终任务完成。StarPO-S可优先训练不确定样本,但必须增加过程奖励,避免把格式化思考误认为真实解释。

远期愿景

可自我改进的机器人与通用代理

若能获得可靠的过程监督,StarPO式训练可让机器人在随机环境中持续学习规划。主要障碍是现实试错成本、安全约束、长时域信用分配及从模拟器迁移到现实。

原文摘要

Training large language models (LLMs) as interactive agents presents unique challenges including long-horizon decision making and interacting with stochastic environment feedback. While reinforcement learning (RL) has enabled progress in static tasks, multi-turn agent RL training remains underexplored. We propose StarPO (State-Thinking-Actions-Reward Policy Optimization), a general framework for trajectory-level agent RL, and introduce RAGEN, a modular system for training and evaluating LLM agents. Our study on four stylized environments reveals three core findings. First, our agent RL training shows a recurring mode of Echo Trap where reward variance cliffs and gradient spikes; we address this with StarPO-S, a stabilized variant with trajectory filtering, critic incorporation, and gradient stabilization. Second, we find the shaping of RL rollouts would benefit from diverse initial states, medium interaction granularity and more frequent sampling. Third, we show that without fine-grained, reasoning-aware reward signals, agent reasoning hardly emerge through multi-turn RL and they may show shallow strategies or hallucinated thoughts. Code and environments are available at https://github.com/RAGEN-AI/RAGEN.

cs.LG cs.AI cs.CL