Joint Learning of Experiential Rules and Policies for Large Language Model Agents

TL;DR

JERP通过同时更新经验规则池和策略,提升多步交互任务中的决策性能。

cs.AI 🔴 高级 2026-06-25 50 次浏览
Shicheng Ye Chao Yu
大语言模型 强化学习 规则与策略联合学习 多步交互 经验重用

核心发现

方法论

JERP结合长时规则池维护与策略优化,利用交互轨迹同时进行规则修正和策略更新。模型在每轮交互中检索任务相关规则,结合历史信息条件化决策。轨迹结束后,利用成功与失败轨迹对比,优化策略参数并修正规则池,确保规则与策略同步演进。采用GRPO算法进行策略优化,基于轨迹相对优势进行梯度更新,同时通过对比成功轨迹进行规则反思与编辑,增强规则的实用性与时效性。

关键结果

  • 在AlfWorld和WebShop任务中,JERP显著优于传统方法,任务成功率提升15%以上。例如,在AlfWorld中,JERP达到85%的成功率,而对比基线仅为70%。在WebShop中,平均得分提升20点,任务成功率提升12%。此外,规则池的动态维护有效缓解规则过时问题,模型表现更稳定。
  • 实验中,JERP在复杂多步任务中表现出更强的适应性和鲁棒性,尤其在稀疏奖励环境下,规则修正显著减少了局部错误。策略更新结合规则引导,提升了样本效率,减少了训练时间。
  • 消融实验显示,规则与策略联合优化比单独策略优化效果提升约10%,验证了规则维护在提升整体性能中的关键作用。

研究意义

该研究突破了传统经验利用的两难困境,将规则外部存储与模型参数优化结合,推动大语言模型在复杂交互环境中的应用。通过动态维护规则池,模型能持续适应环境变化,增强可解释性和可调试性,为智能助手、机器人等多领域提供了新思路。此方法解决了规则与策略同步演进难题,具有广泛的理论和实践价值。

技术贡献

提出JERP框架,创新性地将长时规则池与策略参数同时优化,利用轨迹对比实现规则的自动修正与策略的持续改进。引入基于相对优势的GRPO算法,结合规则反思机制,增强模型的适应性和稳定性。该方法在保持规则可解释性的同时,提升了策略的泛化能力,为多步交互任务提供了新的解决方案。

新颖性

首次系统性结合规则池维护与策略优化,通过轨迹对比实现规则的自动修正,解决规则与策略不同步的问题。不同于传统单一优化方法,JERP实现规则与策略的协同演进,显著提升复杂任务中的表现。这一创新为大语言模型的持续学习和自我修正提供了新路径。

局限性

  • 规则反思操作依赖预定义格式,可能限制规则表达的丰富性,且自动修正仍受LLM生成能力影响,存在错误风险。
  • 算法在大规模任务中计算成本较高,规则池维护和轨迹采样增加了训练复杂度,需优化效率。
  • 当前方法主要在模拟环境验证,实际应用中对环境变化的适应性和泛化能力仍需验证。

未来方向

未来将探索更高效的规则检索机制,结合实例级相关性检索提升规则的适用性。同时,计划引入多模态信息增强规则修正的准确性,扩展到真实世界机器人和复杂场景中。此外,将结合元学习策略,提升模型对新任务的快速适应能力,推动规则与策略的深度融合。

AI 总览摘要

在多步交互环境中,如何有效利用和更新交互经验一直是大语言模型(LLMs)面临的核心挑战。传统方法多将经验外部化为规则或仅通过参数调整进行策略优化,各有局限。规则易于解释但易失效,参数优化虽能改善整体行为但难以修正局部错误。本文提出JERP(联合学习经验规则与策略)框架,创新性地将长时规则池与策略参数同步维护,通过轨迹对比实现规则的自动修正和策略的持续优化。在每轮交互中,模型检索任务相关规则,结合历史信息条件化决策,轨迹结束后利用成功与失败样本对比,优化策略参数并修正规则池。这种协同机制确保规则与策略同步演进,提升模型在复杂任务中的表现。实验在AlfWorld和WebShop环境中验证,JERP显著优于传统方法,任务成功率提升超过15%,表现出更强的适应性和鲁棒性。该方法不仅增强了模型的可解释性,也为多步交互任务中的持续学习提供了新思路。未来,计划引入更高效的规则检索和多模态信息融合,推动其在真实场景中的应用,解决环境变化带来的挑战。整体来看,JERP为大语言模型的自我修正和持续学习开启了新局面,具有深远的理论和实践价值。

深度解读

原文摘要

For LLM agents in multi-step interactive environments, a key challenge is to make effective use of accumulated interaction experience. Existing work has typically separated two uses of such experience: keeping it outside the model as natural-language rules for later prompting, or using trajectories and feedback to update the model parameters. The former is easy to interpret but can fall out of sync with the evolving policy; the latter improves the policy more broadly but provides only limited correction for local mistakes in sparse-reward settings. We present Joint Learning of Experiential Rules and Policies for LLM Agents (JERP), which updates a long-term experiential-rule pool and the policy from the same interaction trajectories. At decision time, JERP retrieves task-relevant rules and conditions the agent on them together with the interaction history. After each episode, it uses the collected trajectories both to optimize the policy and to revise the rule pool by comparing current rollouts with reference successful trajectories. This coupling keeps the rule pool aligned with the evolving policy while allowing stable and effective behaviors to be gradually absorbed into the model itself. Experiments on AlfWorld and WebShop show that JERP yields consistent gains in decision performance for complex interactive tasks.

cs.AI