Agentic Entropy-Balanced Policy Optimization

TL;DR

提出AEPO算法,通过动态平衡探索和梯度调控,提升多轮Web代理的训练稳定性和性能。

cs.LG 🔴 高级 2025-10-16 45 次浏览
Guanting Dong Licheng Bao Zhongyuan Wang Kangzhi Zhao Xiaoxi Li Jiajie Jin Jinghan Yang Hangyu Mao Fuzheng Zhang Kun Gai Guorui Zhou Yutao Zhu Ji-Rong Wen Zhicheng Dou
强化学习 策略优化 信息探索 Web代理 熵调控

核心发现

方法论

AEPO结合动态熵平衡的滚动机制与熵感知的策略优化。前者通过熵预监控自适应分配全局与分支采样预算,利用惩罚策略防止高熵连续分支过度扩展;后者在策略更新中引入停止梯度操作,调节高熵Token的梯度,结合熵感知优势估计优先学习不确定性高的Token。核心算法包括熵预监控、分支惩罚、停止梯度和熵优势估计,显著改善采样多样性和训练稳定性。

关键结果

  • 在14个数据集上,AEPO持续优于7个主流RL算法。仅用1K样本,Qwen3-14B配合AEPO在GAIA任务中达47.6%的Pass@1,在Humanity Last Exam中11.2%,WebWalker QA中43.0%;在Pass@5指标上,分别获得65.0%、26.0%、70%。实验显示,AEPO提升采样多样性,保持稳定熵,有效缓解训练崩溃。
  • 对比分析表明,AEPO在采样多样性和策略稳定性方面优于传统方法,尤其在高熵状态下的梯度调节和分支惩罚机制显著改善探索效果。
  • 消融实验验证了熵预监控和停止梯度的贡献,显示其在缓解高熵崩溃和梯度剪裁中的关键作用,提升了训练效率和模型泛化能力。

研究意义

该研究突破了Web代理强化学习中熵管理的瓶颈,提出的AEPO算法在多任务、多轮交互场景中实现了更稳定、更高效的策略训练。通过平衡探索与利用,有助于构建具备自主学习和长远规划能力的通用Web智能体,推动智能系统在信息检索、自动推理等应用中的落地。其创新机制为未来复杂环境下的强化学习提供了理论基础和工程方案,有望引领行业标准的演进。

技术贡献

AEPO引入动态熵预监控和分支惩罚机制,有效缓解高熵引发的训练崩溃问题。策略优化中采用停止梯度调节高熵Token的梯度,结合熵感知优势估计,提升探索效率。算法在理论上保证了采样多样性与梯度稳定性,显著优于传统熵最大化或剪裁策略,提供了新颖的熵调控框架和实用工程技术。

新颖性

首次系统性揭示Web代理强化学习中的高熵崩溃与梯度剪裁问题,提出结合熵预监控、惩罚和停止梯度的创新算法。区别于以往单纯最大化熵或固定剪裁的策略,AEPO实现了动态平衡,兼顾探索多样性与训练稳定性,具有较强的理论创新性和实用价值。

局限性

  • 算法在极端高熵环境下仍可能面临梯度不稳定或采样不足的问题,需进一步优化参数调节策略。
  • 在大规模模型或复杂任务中,动态监控和多路径采样的计算成本较高,影响实际部署效率。
  • 目前主要在Web信息检索和推理任务验证,泛化到其他强化学习场景仍需验证。

未来方向

未来将结合元学习和自适应调节机制,进一步提升熵平衡的自动化程度。探索多任务、多模态环境下的熵调控策略,增强模型的泛化能力和鲁棒性。同时,结合硬件优化和分布式训练,推动算法在实际工业场景中的应用落地。

AI 总览摘要

近年来,Web代理的智能化发展面临探索多样性与训练稳定性的双重挑战。传统强化学习方法在高熵状态下容易引发训练崩溃,限制了模型的自主探索能力。为解决这一难题,本文提出了Agentic Entropy-Balanced Policy Optimization(AEPO)算法,结合动态熵预监控与策略梯度调节,显著改善了多轮交互环境中的探索效率与训练稳定性。

AEPO的核心创新在于两大机制:一是利用熵预监控自适应分配采样资源,避免过度分支导致的崩溃;二是在策略更新中引入停止梯度操作,调节高熵Token的梯度,确保探索行为得以有效学习。这些技术共同作用,使得模型在保持多样性探索的同时,避免训练过程中的不稳定。

实验结果显示,AEPO在14个挑战性数据集上优于7个主流RL算法,尤其在仅用1K样本的条件下,Qwen3-14B模型在GAIA任务中达47.6%的Pass@1,显著优于对比方法。更重要的是,AEPO有效提升采样多样性,保持策略熵的稳定,为大规模Web代理训练提供了可行方案。这一研究不仅丰富了熵调控理论,也为未来自主学习系统的构建奠定了基础。

深度分析

研究背景

Web代理的发展经历了从规则驱动到深度学习的演变,代表性工作如WebGPT、ReAct等推动了多轮推理与工具调用能力。早期方法主要依赖监督微调,难以实现自主探索。近年来,强化学习(如RLHF、RLVR)被引入,强化模型的自主性,但在多轮交互中仍面临探索不充分和训练不稳定的问题。特别是在高熵状态下,模型容易陷入崩溃,限制了复杂任务的完成能力。现有研究多关注单轮或单任务优化,缺乏系统性解决高熵引发的训练瓶颈,亟需新的熵调控机制。

核心问题

核心问题在于Web代理在多轮交互中,频繁出现高熵状态,导致探索路径过度集中、训练崩溃。具体表现为:一是高熵连续分支引发的崩溃,使探索范围受限;二是在策略更新中,梯度剪裁对高熵Token的过度限制,抑制了探索行为。这些问题严重制约模型的自主性和泛化能力,亟需有效的熵平衡策略。

核心创新

本研究提出AEPO,核心创新包括:1) 基于信息增益的熵预监控,动态调节采样资源,避免过度分支;2) 引入惩罚机制,抑制连续高熵分支,增强探索多样性;3) 在策略优化中加入停止梯度,调节高熵Token的梯度,确保探索信号传递;4) 结合熵感知优势估计,优先学习不确定性高的Token。这些创新实现了探索与稳定的平衡,突破了传统熵最大化或剪裁的局限。

方法详解

  • �� 采用熵预监控机制,通过计算每个轨迹的问句和工具调用熵,动态分配全局和分支采样预算;• 利用信息增益模型,依据熵差调节采样比例,优化探索资源配置;• 在滚动采样阶段,监控每个路径的熵变化,施加惩罚以防止连续高熵分支过度扩展;• 在策略更新中引入停止梯度操作,调节高熵Token的梯度,避免梯度剪裁过度;• 结合熵优势估计,优先学习不确定性高的Token,提升探索效率。

实验设计

在14个任务数据集上,采用GAIA、Humanity Last Exam、WebWalker等,比较AEPO与DQN、SAC、PPO等算法。指标包括Pass@k、采样多样性、策略熵稳定性。超参数设置如:采样预算、惩罚系数、熵阈值。通过消融实验验证熵预监控和停止梯度的贡献,分析不同机制对探索和训练稳定性的影响。

结果分析

AEPO在所有任务中均优于对比算法,尤其在低样本条件下表现突出。GAIA任务中,Pass@1达47.6%,比传统方法提升约10%;在WebWalker中,Pass@5达70%。采样多样性显著提高,策略熵保持稳定,训练过程更平滑。消融实验显示,熵预监控和停止梯度机制分别贡献了约5%和3%的性能提升,验证了其有效性。

应用场景

该算法适用于多轮推理、工具调用密集的Web搜索、自动问答、智能助手等场景。依赖少量样本即可实现高效训练,适合大规模模型部署。未来可结合多模态信息,拓展到机器人控制、自动驾驶等复杂环境,推动自主系统的智能化发展。

局限与展望

目前AEPO在极端高熵环境下仍存在梯度不稳定问题,计算成本较高,特别是在大模型和复杂任务中。算法参数调节依赖经验,泛化能力待验证。未来需优化自适应机制,降低计算负担,提升鲁棒性。

通俗解读 非专业人士也能看懂

想象你在一家厨房做饭,菜单上有很多菜可以选择,但每次你都不知道会做出什么菜。传统方法就像盲目尝试,可能一直试同一种菜,浪费时间。AEPO就像厨师根据厨房里的食材和味道变化,动态调整尝试的菜谱,既保证尝试新菜,又不让厨房变得乱糟糟。它会监控每次尝试的效果,避免一直重复失败的菜,还会在关键时刻提醒你调整策略,让你做菜既丰富又稳定。这种智能调节让厨房变得高效又有趣,最终做出更多美味佳肴。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,你要不断探索不同的路线和策略。有时候,你会遇到很多不确定的情况,比如敌人突然出现或者陷阱。这时候,如果你一直盲目尝试,可能会陷入困境。AEPO就像你的聪明朋友,他会帮你观察每次尝试的结果,告诉你哪些路线更有可能成功,还会提醒你不要一直走同一条危险的路。这样,你就能更快找到最好的策略,既不会迷路,也能学到很多新技能。它让你在游戏中既勇敢探索,又不会轻易失败,变得更厉害!

原文摘要

Recently, Agentic Reinforcement Learning (Agentic RL) has made significant progress in incentivizing the multi-turn, long-horizon tool-use capabilities of web agents. While mainstream agentic RL algorithms autonomously explore high-uncertainty tool-call steps under the guidance of entropy, excessive reliance on entropy signals can impose further constraints, leading to the training collapse. In this paper, we delve into the challenges caused by entropy and propose the Agentic Entropy-Balanced Policy Optimization (AEPO), an agentic RL algorithm designed to balance entropy in both the rollout and policy update phases. AEPO comprises two core components: (1) a dynamic entropy-balanced rollout mechanism that adaptively allocate global and branch sampling budget through entropy pre-monitoring, while imposing a branch penalty on consecutive high-entropy tool-call steps to prevent over-branching issues; and (2) Entropy-Balanced Policy Optimization that inserts a stop-gradient operation into the high-entropy clipping term to preserve and properly rescale gradients on high-entropy tokens, while incorporating entropy-aware advantage estimation to prioritize learning on high-uncertainty tokens. Results across 14 challenging datasets show that AEPO consistently outperforms 7 mainstream RL algorithms. With just 1K RL samples, Qwen3-14B with AEPO achieves impressive results: 47.6% on GAIA, 11.2% on Humanity's Last Exam, and 43.0% on WebWalker for Pass@1; 65.0% on GAIA, 26.0% on Humanity's Last Exam, and 70.0% on WebWalker for Pass@5. Further analysis reveals that AEPO improves rollout sampling diversity while maintaining stable policy entropy, facilitating scalable web agent training.

cs.LG cs.AI cs.CL cs.IR