Are Online Skill and Memory Modules Always Worth Their Tokens? A Budget-Constrained Study of Web Agents

TL;DR

本研究评估了在固定推理预算下,技能和记忆模块是否总值得投入代币,结果显示普通Actor在多数场景下表现优越。

cs.CL 🔴 高级 2026-06-13 17 次浏览
Sina Hajimiri Masih Aminbeidokhti Jose Dolz Ismail Ben Ayed Issam H. Laradji Spandana Gella Nicolas Gontier
Web Agents Token Budget Online Augmentation Performance Evaluation Reinforcement Learning

核心发现

方法论

采用WebArena和WorkArena两个基准环境,比较了AWM、ASI和ReasoningBank三种增强方法与匹配预算的基础Actor(Vanilla-IB)。通过控制总推理代币数,分析不同方法在多模型(Gemini 3 Flash、gpt-4o、Qwen 3.6-27B)上的成功率和代币消耗。实验中,所有方法均在多次随机运行中统计成功率和标准差,强调多次运行的变异性对评估的重要性。核心算法包括基于LLM的记忆检索、技能合成和流程引导机制。

关键结果

  • 在WebArena中,Vanilla-IB在成功率和代币效率上均优于增强方法,平均成功率最高,且使用的总代币量更少。例如,Gemini 3 Flash模型中,Vanilla-IB成功率达47.77%,总代币约45.7K,而增强方法如AWM、ASI和ReasoningBank虽在某些任务表现略优,但整体成本更高。
  • 在WorkArena-L1中,Vanilla-IB成功率为55.56%,与ReasoningBank持平,优于AWM和ASI,且总代币消耗更低,显示基础Actor在企业任务中同样具有竞争力。
  • 多次运行结果显示,单次成功率存在显著波动,任务级别的随机性和环境不确定性对评估结果影响巨大,强调多次重复的重要性。

研究意义

本研究挑战了传统观念,即技能和记忆模块在推理任务中必然带来性能提升。结果表明,在有限预算下,简单的Actor通过增加交互次数,往往能获得更优或等效的效果。这对于设计高效、成本敏感的Web智能体具有重要指导意义,促使行业重新审视模块化增强的成本-收益关系。研究还强调了多次运行统计的重要性,为未来Web Agent的评估提供了新的标准。

技术贡献

提出了一种基于预算匹配的比较框架,系统评估了多种增强策略在不同模型和任务中的表现差异。通过引入多次随机运行统计,揭示了单次成功率的局限性。研究还分析了增强模块的代币消耗结构,发现大部分成本来自显式模块调用和上下文膨胀。这为未来设计更高效的增强机制提供了理论基础。

新颖性

首次系统性比较了多种在线增强方法与预算匹配基础Actor的性能差异,强调了多次运行统计在Web Agent评估中的必要性。不同于以往只关注单一成功率,本研究引入多次随机性分析,揭示了方法间真实性能差异,推动了Web Agent评估的科学化。

局限性

  • 实验中预算控制主要依赖Actor最大步数,未能精确匹配所有方法的总代币数,可能影响结果的绝对比较。
  • 多次运行虽揭示了随机性,但未深入分析环境不确定性对不同方法的具体影响。
  • 模型和任务范围有限,未来需扩展到更多复杂环境和更大模型,以验证结论的普适性。

未来方向

未来将探索自适应预算分配策略,结合强化学习优化模块调用与交互次数的平衡。同时,考虑引入更复杂的环境扰动和多模态信息,提升Web Agent的鲁棒性和实用性。还将研究多任务、多模型的泛化能力,推动Web Agent在实际应用中的广泛部署。

AI 总览摘要

随着Web智能体在自动化任务中的应用日益广泛,如何在有限的推理预算内最大化性能成为关键问题。传统观点认为,加入技能和记忆模块能显著提升任务成功率,但这些模块的代币消耗常被忽视,导致成本效益分析不足。本研究通过在WebArena和WorkArena两个多任务环境中,系统比较了三种增强策略(AWM、ASI、ReasoningBank)与预算匹配的基础Actor(Vanilla-IB),揭示了在相同推理成本下,简单Actor通常表现更优或持平。多次随机实验显示,单次成功率存在巨大波动,强调多次运行统计的重要性。结果表明,技能和记忆模块的实际优势在大多数场景中被预算限制所抵消,尤其是在模型能力较强时。这一发现对Web Agent设计提出了新的思考:在成本敏感环境中,增加交互次数可能比复杂模块更具性价比。研究还强调了多次运行统计在评估中的必要性,为未来Web Agent的性能衡量提供了科学依据。总体而言,本研究推动了Web Agent性能评估的科学化,提醒行业关注成本-收益平衡,促进高效、鲁棒的智能体设计。

深度分析

研究背景

Web智能体在自动化任务中的应用不断扩大,早期研究主要集中在利用大规模预训练模型(如GPT-3、GPT-4)实现端到端任务完成。随着任务复杂度增加,研究引入技能、记忆和工作流模块(如Wang et al., 2025a,b; Ouyang et al., 2026)以提升性能。这些方法通过外部知识存储和流程引导,试图弥补模型在长序列推理中的不足。然而,模块调用和上下文膨胀带来的代币消耗未被充分量化,导致成本-收益分析不完整。近年来,WebArena和Mind2Web等基准推动了多步交互环境的建立,为评估Web智能体提供了更真实的场景。模型能力的快速提升(如GPT-5.4、Gemini 3)也使得外部模块的必要性受到质疑,促使学界重新审视增强策略的有效性。

核心问题

在有限推理预算下,是否应优先投入技能和记忆模块,还是通过增加交互次数实现性能提升?传统观点认为外部模块能显著改善任务成功率,但其代币成本未被充分考虑。实际应用中,模型能力不断增强,外部模块的边际收益逐渐递减,甚至可能被成本所抵消。此外,环境随机性和多任务场景增加了评估难度,单次成功率难以反映真实性能。如何在预算限制下科学衡量不同策略的效果,成为关键问题。

核心创新

本研究提出了基于预算匹配的比较框架,系统评估多种增强策略在不同模型和任务中的表现差异。引入多次随机运行统计,揭示了单次成功率的局限性。通过分析模块调用的代币结构,发现大部分成本来自显式调用和上下文膨胀,而非模型本身能力提升。这一方法创新性地结合了成本控制与性能评估,为Web智能体的设计提供了新的理论基础。

方法详解

  • �� 设计多任务、多模型环境(WebArena和WorkArena)进行评估。
  • �� 比较三种增强方法(AWM、ASI、ReasoningBank)与匹配预算的基础Actor(Vanilla-IB)。
  • �� 控制Actor最大步数(如15步)作为预算控制手段,确保总代币消耗相近。
  • �� 在每个任务中多次随机运行(至少三次),统计成功率和标准差。
  • �� 详细分析模块调用的代币消耗(包括提示和调用成本)与环境交互的代币消耗。
  • �� 通过扩展Actor步数(如Reddit中的25步)验证预算和性能关系。
  • �� 比较不同模型(Gemini 3、gpt-4o、Qwen 3.6-27B)上的表现差异。
  • �� 重点关注多次运行的变异性和任务级别的随机性对评估的影响。

实验设计

采用WebArena和WorkArena两个环境,涵盖购物、Reddit、管理后台和企业软件任务。模型包括Gemini 3 Flash、gpt-4o和Qwen 3.6-27B。每个配置进行三次独立随机运行,统计成功率和总代币消耗。比较方法包括增强策略(AWM、ASI、ReasoningBank)与基础Actor(Vanilla-IB),后者通过延长Actor步数(如15步)实现预算匹配。实验中还分析了模块调用的具体代币结构,验证了成本主要来自显式调用和上下文膨胀。

结果分析

Vanilla-IB在WebArena中成功率最高,且总代币消耗最低。例如,Gemini 3模型中,成功率为47.77%,总代币约45.7K,而增强方法虽有提升,但成本更高。在WorkArena-L1中,Vanilla-IB成功率55.56%,与ReasoningBank持平,且用币更少。多次运行显示,单次成功率存在显著波动,强调多次统计的重要性。扩展Actor步数(如Reddit中的25步)后,Vanilla-IB表现优于增强方法,验证了预算和交互次数的关系。

应用场景

该研究为Web智能体设计提供了成本效益分析工具,适用于需要在预算限制下优化性能的场景,如企业自动化、客户服务和内容管理。通过合理配置Actor步数,减少不必要的模块调用,提升系统整体效率。未来,结合强化学习优化预算分配,将进一步提升Web Agent在复杂环境中的表现。

局限与展望

实验主要依赖Actor最大步数作为预算控制手段,未能完全匹配总代币数,可能影响结果的绝对比较。多次运行虽揭示随机性,但未深入分析环境不确定性对不同方法的影响。模型和任务范围有限,未来需扩展到更复杂环境和更大模型,以验证结论的普适性。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,手边有各种调料和工具。有些厨师喜欢提前准备好所有调料(就像技能和记忆模块),这样可以快速做出菜肴,但每次准备都要花时间和材料(代币)。而另一些厨师则喜欢边做边试(增加交互次数),用有限的材料不断尝试,最终也能做出美味菜肴。研究发现,在预算有限的情况下,直接多试几次(多交互)往往比提前准备好所有调料更省钱又有效。就像厨房里,简单的厨师用有限材料多试几次,反而比那些提前准备好所有调料的厨师更快做出好菜。这说明,复杂的外部工具未必总是值得花费更多资源,直接多尝试可能更划算。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你可以用点数(像代币)来买装备或者多试几次。有人说,花点点买装备(技能和记忆)可以帮你更快赢,但其实在点数有限的情况下,多试几次(多交互)反而更有效。比如,你用点数多试几次,可能比用点数买很多装备还更容易赢。这个研究就告诉我们,在有限的点数里,直接多试几次,可能比买很多装备更聪明。它还发现,很多时候,单次试几次的成功率会有很大波动,所以要多试几次才能知道自己到底行不行。就像你打游戏,偶尔会遇到运气不好,但多玩几次就能看出自己真正的水平。这个发现对设计智能机器人也很重要:不要总想着用复杂的工具,简单多试试,反而更划算!

原文摘要

Online web agents often augment a base actor with memory, workflow, or skill modules. These modules can improve performance, but they also consume test-time tokens, a cost rarely reported alongside the actor's inference cost. We study online augmentation, where this overhead is paid on every task, and re-evaluate its benefits under a fixed total inference budget. We compare AWM, ASI, and ReasoningBank with a token-matched vanilla baseline that uses the same budget for additional actor steps. Across four WebArena domains and three models, Gemini 3 Flash, GPT-5.4-mini, and Qwen 3.6-27B, the vanilla baseline matches or surpasses all three augmentation methods in aggregate success rate while often using fewer total tokens. We observe a similar trend on WorkArena-L1 with Qwen 3.6-27B, indicating that the effect extends to enterprise knowledge-work tasks. Our results suggest that skills and workflow memory can be useful in specific domains, but their apparent gains often vanish against a budget-matched actor. We further show that run-to-run variance materially affects outcomes and should be reported as a core evaluation criterion for online web agents.

cs.CL