On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification

TL;DR

本研究系统评估基于记忆的自我提升智能体的脆弱性,发现其在任务变异和顺序变化中表现出显著不稳定性,提出通过信息丰富化缓解部分性能下降。

cs.AI 🔴 高级 2026-08-19 87 次浏览
Qinyuan Ye Yu Li Yada Pruksachatkun Jiaxin Zhang Chien-Sheng Wu
人工智能 自我提升 记忆机制 系统评估 鲁棒性

核心发现

方法论

本研究采用多次重复实验和随机任务打乱两种策略,系统评估两种代表性记忆增强方法(AWM与RBank)在WebArena、VisualWebArena和SCUBA三大基准上的表现。通过引入多次运行统计指标(如平均成功率、标准差和最大最小差)量化结果的变异性,并在不同任务顺序下测试模型性能变化,揭示了方法在复杂环境中的不稳定性。研究还结合人工分析,检视记忆内容,发现任务与环境的未充分定义(underspecification)是导致性能波动的关键因素。最后,加入详细任务规程和环境反馈信息,部分缓解了性能下降,但仍存在较大差距,提示其他未识别因素的影响。

关键结果

  • 在WebArena的180个任务中,单次运行的成功率差异最高达4.4%,标准差达1.98%,而引入自我提升机制后,变异性明显增加,最大差异达7.8%。在多次实验中,性能的最高与最低表现差距可达10个百分点,显示出极高的不确定性。
  • 在任务顺序方面,默认的任务排列隐含易到难的隐性课程,模型在此顺序下平均提升1.5%;但在随机打乱任务顺序后,性能反而下降了4.5%,说明任务顺序对模型效果影响巨大,且当前方法对顺序敏感。
  • 通过人工分析记忆内容,发现未充分定义的环境信息(如API支持情况)和模糊任务描述导致模型生成不适用的记忆(如建议API调用在浏览器环境中不可行),引发误导和性能波动。加入环境反馈和详细规程后,性能改善约31%,但仍未解决全部问题。

研究意义

本研究首次系统揭示了基于记忆的自我提升智能体在复杂环境中的脆弱性,强调了多次实验和任务顺序变化在评估中的重要性。其发现对学术界理解模型稳定性具有深远意义,也为工业应用中的可靠性保障提供了警示。通过深入分析未充分定义的任务和环境信息,推动了智能体设计中信息丰富化的研究方向,有助于未来开发更鲁棒、可控的自我提升系统,满足高风险场景的需求。

技术贡献

本研究提出了结合多次运行统计和任务随机打乱的系统评估框架,显著提升了对模型稳定性和鲁棒性的理解。引入详细任务规程和环境反馈信息,作为记忆构建的补充,有效缓解了性能波动。通过人工分析记忆内容,识别出未定义环境和任务信息是性能不稳定的根源,为后续设计提供了理论依据。此外,研究强调了评估多样性的重要性,推动了自我提升智能体的可靠性评估标准的建立。

新颖性

本工作首次系统性地将多次实验和任务随机打乱结合,全面揭示记忆增强方法在复杂环境中的脆弱性。提出通过信息丰富化(如任务规程和环境反馈)改善记忆质量的策略,填补了现有文献中对模型稳定性和可靠性缺乏深入分析的空白。与传统只关注性能提升的研究不同,本研究强调模型在多次运行和不同任务顺序下的表现一致性,推动了自我提升系统的鲁棒性研究新方向。

局限性

  • 尽管引入了丰富信息以缓解性能波动,但仍未完全解决模型在极端任务顺序和环境变化下的表现不稳定问题,部分原因在于未能覆盖所有潜在未定义场景。
  • 实验主要集中在Web浏览任务,缺乏对其他复杂任务域(如多模态、多任务学习)的验证,限制了方法的普适性。
  • 增加信息丰富化会带来额外的计算和设计成本,实际部署中需要权衡效率与鲁棒性,未来需优化信息整合机制。

未来方向

未来应探索更全面的任务和环境建模方法,提升模型对未定义场景的适应能力。同时,建立标准化的多次运行和任务顺序测试流程,确保模型在实际应用中的稳定性。研究还应关注人类监督接口的设计,增强模型的可解释性和可控性,避免潜在的不可预见的失败。最终目标是实现高可靠性、可调控的自我提升智能体,广泛应用于高风险行业如医疗、金融和自动驾驶。

AI 总览摘要

近年来,基于记忆的自我提升智能体在人工智能领域引起了广泛关注。这类系统通过维护文本记忆库,在线学习并不断优化其任务执行能力,展现出巨大的潜力,尤其在自动化复杂任务和开放式探索中表现出色。然而,随着其应用范围的扩大,系统的可靠性问题日益凸显。传统评估多采用单次运行的成功率指标,忽视了模型在不同运行中的表现波动,导致对其稳定性和鲁棒性的认识不足。

本研究针对这一短板,系统引入多次重复实验和任务随机打乱两种策略,全面评估两种代表性记忆增强方法(Agent Workflow Memory和ReasoningBank)在WebArena、VisualWebArena和SCUBA三个基准上的表现。结果显示,模型在复杂环境中表现出显著的变异性,最大成功率差异达4.4%,多次运行的标准差高达1.98%。更令人担忧的是,加入自我提升机制后,变异性进一步放大,最大差异达7.8%,显示出极高的不确定性。

此外,研究发现任务顺序对模型性能影响极大。默认的任务排列隐含易到难的隐性课程,模型在此顺序下能略有提升,但在随机打乱任务顺序后,性能反而下降了4.5%。这一发现表明,当前方法对任务顺序极为敏感,难以应对实际应用中任务顺序的随机性。通过人工分析记忆内容,揭示未充分定义的环境信息(如API支持情况)和模糊任务描述是性能波动的主要原因。引入详细任务规程和环境反馈信息后,性能有所改善,但仍存在较大差距。

这些发现对未来的研究和应用具有重要启示。首先,强调了多次实验和多样任务顺序评估的重要性,以确保模型的稳定性和可靠性。其次,提示在模型设计中应充分考虑环境和任务的明确定义,避免未定义信息带来的误导。最后,推动建立更完善的人机交互接口,增强模型的可控性和可解释性,防止潜在的系统性失败。未来工作应在更广泛的任务域中验证方法的普适性,优化信息整合机制,并探索高风险场景下的鲁棒性保障策略,以实现真正可靠的自我提升智能体。

深度分析

研究背景

近年来,人工智能领域对自我提升智能体的研究逐渐深入,旨在开发能够自主学习和优化的系统。早期工作如GPT-3、GPT-4等大型语言模型的成功,推动了基于记忆的系统设计,特别是在任务连续性和知识积累方面的应用。代表性方法包括Agent Workflow Memory(AWM)和ReasoningBank(RBank),它们通过维护结构化或非结构化的记忆,增强模型的推理和任务适应能力。这些系统在Web浏览、自动化办公等场景中取得一定成果,但大多只关注性能指标,缺乏对其稳定性和鲁棒性的系统性评估。随着任务复杂度增加,模型表现出明显的随机性和对任务顺序的敏感性,亟需引入多次实验和环境扰动的评估策略,以确保其在实际应用中的可靠性。

核心问题

尽管基于记忆的自我提升方法在实验中表现出一定优势,但其在复杂环境中的稳定性不足成为制约其实际应用的瓶颈。具体表现为:模型在多次运行中的性能差异较大,最大成功率差异可达10个百分点;此外,模型对任务顺序极为敏感,随机打乱任务顺序后性能明显下降。这些问题源于模型在记忆构建时未充分定义环境和任务信息,导致生成的记忆内容不符合实际环境需求,甚至出现误导性记忆,影响后续任务的执行效果。解决这些问题对于实现高可靠性、可控的自我提升系统具有重要意义,尤其在高风险场景中更为关键。

核心创新

本研究的核心创新在于:• 引入多次运行和任务随机打乱的系统评估框架,全面揭示模型在不同条件下的稳定性问题;• 结合人工分析,识别未充分定义的环境和任务信息(underspecification)为性能波动的根源;• 提出在记忆构建阶段加入详细任务规程和环境反馈信息的策略,有效缓解性能下降。这些创新突破了传统只关注单次性能的评估方式,为模型鲁棒性提供了新的检测和改进途径。特别是在复杂、多变的实际场景中,这些方法显著提升了模型的稳定性和可靠性,为未来自我提升系统的设计提供了理论基础。

方法详解

  • �� 设计多次重复实验:对每个任务集进行至少三次独立运行,统计成功率的平均值、标准差和最大最小差,量化模型的变异性。
  • �� 任务随机打乱:在标准任务顺序基础上,生成Shuffle-1和Shuffle-2两种随机任务顺序,评估模型在不同任务排列下的性能变化。
  • �� 记忆内容分析:人工检查模型生成的记忆,识别未定义的环境信息(如API支持)和任务描述模糊引起的误导性记忆。
  • �� 信息丰富化:在记忆构建阶段加入详细任务规程(rubrics)、环境反馈(如API支持状态)和提示修改(prompt refinement),以提高记忆的准确性和相关性。
  • �� 实验基准:采用WebArena、VisualWebArena和SCUBA三个公开数据集,比较基线模型(gpt-4o)与增强模型的性能差异,重点关注多次运行的统计指标和任务顺序变化的影响。

实验设计

  • �� 数据集选择:WebArena(812任务)、VisualWebArena(910任务)和SCUBA(267任务),涵盖多种网页浏览和企业自动化场景。
  • �� 评估指标:成功率(pass@1)、成功率标准差、最大最小差、性能变化百分比。
  • �� 实验设计:对每个模型在不同任务顺序(默认、Shuffle-1、Shuffle-2)下进行三次独立运行,统计性能波动。
  • �� 超参数:采用gpt-4o作为基础模型,记忆构建模型使用Ground-truth奖励,避免噪声干扰。
  • �� 附加分析:人工检查记忆内容,识别未定义信息,验证信息丰富化策略的效果。

结果分析

  • �� 多次实验显示,模型在复杂环境中表现出高度变异性,最大成功率差异达4.4%,标准差达1.98%,多次运行的最大差异达7.8%。
  • �� 任务顺序的改变极大影响性能,随机打乱后,WebArena模型性能下降4.5%,而在默认顺序下则略有提升1.5%。
  • �� 记忆内容分析揭示,未定义环境信息(如API支持)和模糊任务描述导致模型生成不适用或误导性记忆,影响后续任务。
  • �� 通过加入详细规程和环境反馈信息,性能改善约31%,但仍存在较大差距,表明其他未识别因素仍在影响模型稳定性。

应用场景

  • �� 立即应用:在企业自动化、网页智能助手、客户服务等场景中,提升系统的稳定性和可靠性,减少因模型不稳定带来的风险。
  • �� 长远愿景:推动自我提升智能体在高风险领域(如医疗诊断、金融决策、自动驾驶)中的应用,实现真正的自主学习与安全保障,为未来智能系统的可信赖性奠定基础。

局限与展望

  • �� 当前方法主要集中在网页浏览任务,尚未验证在多模态、多任务等更复杂场景中的效果。
  • �� 信息丰富化策略增加了模型的计算成本和设计复杂度,实际部署时需权衡效率与鲁棒性。
  • �� 仍未完全解决极端任务顺序和环境变化带来的性能不稳定问题,未来需进一步优化模型的适应能力。

通俗解读 非专业人士也能看懂

想象一下你在一家工厂工作,这个工厂每天都要完成不同的任务,比如组装、包装、检验等。工厂里的工人(就像AI模型)会记住之前做过的事情,试图用这些记忆来帮助自己更快完成新任务。可是,有时候工人会记错或记得不完整,比如把某个工具用错了,或者忘记了某个步骤。工厂的任务每天都在变,有时候新任务和旧任务不一样,工人如果没有明确的指示或详细的说明,就可能会出错。这个研究就像是在问:如果工人没有得到清楚的说明,或者工厂的任务顺序随机变化,他们还能保持高效率吗?答案是:不一定。研究发现,工人在没有充分信息的情况下,容易记错或迷失方向,导致工作效率大打折扣。为了让工人更可靠,工厂可以提供更详细的操作规程和反馈信息,帮助他们更好地完成任务。这个比喻告诉我们,AI系统也是一样,只有在任务和环境信息充分明确的情况下,才能保持稳定和高效。

简单解释 像给14岁少年讲一样

想象你在学校里学习新技能,比如弹吉他。每次练习后,你会记下一些笔记,告诉自己哪些地方弹得好,哪些地方还需要改进。随着时间推移,你会不断回顾这些笔记,试图变得更厉害。但是,如果你的笔记写得不清楚,比如没有写明具体的指法或者没有说明练习的重点,你可能会记错内容,甚至练习出错。现在,假设你每天都在不同的时间练习,顺序也不一样。有时候你练的顺序是从简单到困难,有时候却是随机的。你会发现,顺序不同,效果也不同。有时候你会觉得自己变得更厉害,但有时候又会退步。这就像论文里的模型一样:它们通过记忆之前的任务来学习,但如果记忆中包含了不正确或不完整的信息,或者任务顺序变化太大,模型的表现就会变得不稳定。研究发现,给模型提供更详细的任务说明和环境信息,可以帮助它们更好地记忆和学习,就像你写得清楚的笔记能帮你更快进步一样。这项研究告诉我们,要让AI变得更聪明、更可靠,就像学习一样,细节和顺序都很重要。

术语表

Self-Improving Agent (自我提升智能体)

一种能够从经验中不断学习和优化自身性能的人工智能系统,具有自主改进能力。

论文中描述的系统通过维护记忆库实现自我提升。

Memory Bank (记忆库)

存储模型在任务执行过程中积累的文本信息,用于后续任务的参考和推理。

两种方法(AWM和RBank)都依赖于记忆库来增强模型性能。

Variance (方差)

多次实验结果的离散程度,反映模型在不同运行中的表现稳定性。

论文中用来衡量模型在多次实验中的性能波动。

Underspecification (未充分定义)

任务或环境中缺乏详细说明,导致模型生成不适用或误导的记忆。

分析模型性能波动的主要原因之一。

Task Order (任务顺序)

任务在执行中的排列顺序,影响模型学习和表现。

研究中通过打乱任务顺序测试模型鲁棒性。

Rubrics (评分标准)

用于评估任务完成情况的详细规则或指标。

加入详细评分标准帮助模型生成更准确的记忆。

Environment Feedback (环境反馈)

环境状态或支持信息,用于指导模型更合理地构建记忆。

引入后改善了模型的性能稳定性。

Self-Improvement Loop (自我提升循环)

模型在完成任务后,通过记忆和学习不断优化自身能力的过程。

论文评估的核心机制之一。

WebArena, VisualWebArena, SCUBA

不同的网页浏览和企业自动化任务基准,用于评估模型性能。

论文中用作实验数据集。

Ground-truth reward (真实奖励)

在训练中提供的准确奖励信号,用于指导模型学习。

避免噪声干扰,提升记忆构建质量。

开放问题 这项研究留下的未解疑问

  • 1 尽管引入多次实验和任务随机打乱揭示了模型的脆弱性,但尚未明确所有未定义信息(如环境约束、任务模糊性)对性能的具体影响机制。未来需要深入研究不同类型未定义信息对模型表现的影响程度,以及如何系统性地识别和补充这些信息,以实现更鲁棒的自我提升系统。
  • 2 目前的研究主要集中在网页浏览任务,尚未扩展到多模态、多任务或连续学习场景,未来应验证方法在更复杂、多样的任务环境中的适用性和效果。
  • 3 引入丰富信息(如详细规程和环境反馈)虽然改善了性能,但也带来了额外的计算成本和系统复杂性,如何在保证效率的同时提升模型鲁棒性,是未来的重要研究方向。
  • 4 模型对任务顺序的敏感性仍未完全解决,未来应探索更具泛化能力的训练策略和模型结构,以适应随机任务流和环境变化。
  • 5 缺乏标准化的多次运行和任务扰动评估流程,未来应建立行业标准,确保模型在实际部署中的表现一致性和可靠性。

应用场景

近期应用

企业自动化流程优化

利用鲁棒的自我提升模型提升企业网页自动化、客户服务机器人等应用的稳定性,减少因模型不稳定带来的误操作和服务中断。

智能网页助手

开发基于记忆的网页浏览助手,提供更准确的搜索和信息提取,增强用户体验,特别是在复杂或多变的网页环境中。

高风险场景中的AI决策支持

在医疗、金融等高风险领域部署更可靠的自我提升系统,确保模型在多次运行和环境变化中保持稳定,降低潜在风险。

远期愿景

自主学习与安全保障

实现具有高度鲁棒性和可控性的自我提升智能体,具备在未知环境中持续学习和安全操作的能力,推动AI自主决策的普及。

行业标准与评估体系建立

建立全面、多维的模型鲁棒性评估标准,推动行业对自我提升系统的性能和可靠性要求,为未来AI系统的广泛应用提供保障。

原文摘要

Memory-based self-improving agents--those that learn from an online stream of tasks and improve over time by maintaining a textual memory bank--have shown great promise in recent literature. However, the reliability aspects of these methods have been critically overlooked. In this work, we conduct a comprehensive re-evaluation of two memory-based methods, broadening the scope of evaluation along two axes: (1) including multiple runs to quantify variance, and (2) randomly shuffling the tasks to investigate the effect of task order. Through these experiments, we make two observations that expose the fragility of current methods: First, agent evaluation is inherently noisy in complex environments and on multi-step tasks, and stacking a self-improving loop on top can further amplify this noise. Second, the agent's improvement is highly dependent on task order. Prior works often adopt default orderings that impose an implicit curriculum, acting as a hidden prerequisite for success. To better understand this fragility, we manually examine the agents' memory and hypothesize that task and environment underspecification contribute to this fragility. We validate this hypothesis by incorporating information that enables better specification, such as detailed rubrics and environment feedback, into the memory construction process. While this added information partially closes the performance degradation in previous experiments, significant gaps still remain, suggesting that other uncharacterized factors contribute to this fragility. Looking ahead, our work advocates for more rigorous evaluation protocols for self-improving agents by reporting results across multiple runs and stress-testing them under challenging conditions. Moreover, our findings on underspecification call for systems and interfaces that enable effective human oversight, preventing agents from failing in unforeseeable ways.

cs.AI cs.CL cs.LG

参考文献 (20)

VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks

Jing Yu Koh, Robert Lo, L. Jang 等

2024 679 引用 ⭐ 高影响力

Agent Workflow Memory

Z. Wang, Jiayuan Mao, Daniel Fried 等

2024 236 引用 ⭐ 高影响力 查看解读 →

WebArena: A Realistic Web Environment for Building Autonomous Agents

Shuyan Zhou, Frank F. Xu, Hao Zhu 等

2023 1840 引用 ⭐ 高影响力 查看解读 →

Towards a Science of AI Agent Reliability

Stephan Rabanser, Sayash Kapoor, Peter Kirgis 等

2026 45 引用 ⭐ 高影响力 查看解读 →

Large Language Models Can Self-Improve

Jiaxin Huang, S. Gu, Le Hou 等

2022 890 引用 ⭐ 高影响力 查看解读 →

Learning Next Action Predictors from Human-Computer Interaction

Omar Shaikh, Valentin Teutschbein, Kanishk Gandhi 等

2026 4 引用 查看解读 →

Automated Design of Agentic Systems

Shengran Hu, Cong Lu, Jeff Clune

2024 279 引用 查看解读 →

Self-Challenging Language Model Agents

Yifei Zhou, Sergey Levine, J. Weston 等

2025 47 引用 查看解读 →

Deep Reinforcement Learning

Sahil Sharma, A. Srinivas, Balaraman Ravindran

2023 609 引用

Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping

Jesse Dodge, Gabriel Ilharco, Roy Schwartz 等

2020 754 引用 查看解读 →

XSkill: Continual Learning from Experience and Skills in Multimodal Agents

Guanyu Jiang, Zhaochen Su, Xiaoye Qu 等

2026 52 引用 查看解读 →

WALT: Web Agents that Learn Tools

Viraj Prabhu, Yutong Dai, Matthew Fernández 等

2025 10 引用 查看解读 →

Mind Your Format: Towards Consistent Evaluation of In-Context Learning Improvements

Anton Voronov, L. Wolf, Max Ryabinin

2024 100 引用 查看解读 →

Know Me, Respond to Me: Benchmarking LLMs for Dynamic User Profiling and Personalized Responses at Scale

Bowen Jiang, Zhuoqun Hao, Young-Min Cho 等

2025 140 引用 查看解读 →

Proceedings of the 51st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)

K. T. Maxwell, J. Oberlander, W. Bruce Croft

2013 330 引用

EnterpriseOps-Gym: Environments and Evaluations for Stateful Agentic Planning and Tool Use in Enterprise Settings

Shiva Krishna Reddy Malay, Shravan Nayak, Jishnu Sethumadhavan Nair 等

2026 8 引用 查看解读 →

CRMArena-Pro: Holistic Assessment of LLM Agents Across Diverse Business Scenarios and Interactions

Kung-Hsiang Huang, Akshara Prabhakar, Onkar Thorat 等

2025 35 引用 查看解读 →

Huxley-Gödel Machine: Human-Level Coding Agent Development by an Approximation of the Optimal Self-Improving Machine

Wenyi Wang, Piotr Piekos, Nanbo Li 等

2025 31 引用 查看解读 →

SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

Carlos E. Jimenez, John Yang, Alexander Wettig 等

2023 3410 引用 查看解读 →

Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation

Sayash Kapoor, Benedikt Stroebl, Peter Kirgis 等

2025 54 引用 查看解读 →