核心发现
方法论
StateAct采用以代码为核心的多智能体架构,主代理直接操作程序状态,通过持久化的文件、DOM和数据库实现高效任务执行。引入状态优先的动作空间,结合独立验证门控机制,确保任务结构完整性。子代理负责视觉交互,仅在少数场景下调用GUI操作。通过状态外推和上下文管理,保持长时程任务的连续性。实验中,基于Claude Opus 4.8模型,成功率提升至26.9%,成本降低九倍,验证了状态优先策略的有效性。
关键结果
- 在OSWorld 2.0基准测试中,StateAct将二元成功率由20.6%提升至26.9%,部分成功率由54.8%提升至61.6%,显著优于传统视觉驱动方法。成本方面,任务平均花费从72美元降至7.8美元,效率提升近九倍。
- 消融实验显示,去除状态操作会导致成功率下降超过10%,验证了状态操作在长时程任务中的关键作用。独立验证门控机制有效捕获结构性错误,但对价值判断仍有限。
- 系统架构中,状态操作、验证和上下文管理的结合,显著改善了任务的连续性和可靠性,推动长时程自动化向更高层次发展。
研究意义
该研究突破了以像素为中心的感知限制,将程序状态作为核心接口,极大提升了自动化代理在复杂长时任务中的表现。其创新架构和验证机制,为未来自主系统提供了新范式,有望在企业自动化、软件测试等领域实现广泛应用,推动AI在实际操作中的可信度和效率。
技术贡献
提出以程序状态为基础的多智能体架构,结合状态优先的动作空间和独立验证门,突破了传统视觉感知的局限。引入状态外推和上下文管理,有效缓解长时程任务中的信息遗失问题。系统设计兼容多种应用场景,验证机制增强了系统的鲁棒性,为未来长时程自主代理提供了技术基础。
新颖性
首次系统性将程序状态作为自动化任务的核心接口,结合多智能体设计实现长时程任务的高效执行。区别于以像素为主的感知模型,StateAct强调状态优先的操作和验证机制,解决了长时间依赖中信息漂移和结构性错误难以检测的问题。
局限性
- 当前验证机制主要检测结构性错误,对价值判断和推理错误的检测能力有限,仍需引入更深层次的推理验证。
- 系统在极端复杂或高度非结构化环境下表现尚不理想,未来需增强对非结构化内容的理解能力。
- 长时程任务中,子代理的递归深度受限,未来可探索更深层次的递归和自我监督机制。
未来方向
未来将结合深度推理和价值判断机制,提升系统对复杂推理任务的能力。计划引入学习型验证器,增强对非结构化内容的理解。同时,优化子代理的递归策略,支持更长时间跨度的任务,推动自主系统在实际场景中的应用落地。
AI 总览摘要
在自动化任务中,传统方法多依赖视觉感知,受限于像素信息的损失,难以应对复杂长时程任务。StateAct提出一种以程序状态为核心的多智能体架构,通过直接操作文件、DOM和数据库,显著提升任务成功率。其核心创新在于结合状态优先的动作空间、独立验证门和上下文管理,有效缓解信息漂移和结构性错误。实验结果显示,基于Claude Opus 4.8模型,成功率从20.6%提升到26.9%,成本降低九倍,验证了其优越性。这一架构突破了以像素为中心的感知限制,推动自动化代理向更高层次发展。系统设计强调状态操作、验证和长时程管理的协同作用,为未来自主系统提供了新范式。尽管如此,系统在价值推理和非结构化环境中仍有局限,未来将结合深度推理和学习验证机制,持续优化性能,推动行业应用。
深度分析
研究背景
随着AI在自动化领域的不断发展,感知模型如视觉识别已取得显著进步,但在长时程任务中,单纯依赖像素信息存在信息漂移和结构性错误难以检测的问题。早期工作如UI-TARS、GTA等专注于GUI交互或图像识别,但未充分利用程序内部状态。近年来,结合API和代码操作的混合空间逐渐兴起,提升了操作的鲁棒性,但仍面临长时间依赖中的信息遗失和验证困难。StateAct的出现,旨在突破像素感知的局限,将程序状态作为核心接口,结合多智能体架构,解决长时程任务中的连续性和可靠性问题,为自动化代理带来新突破。
核心问题
长时程自动化任务面临信息漂移、结构性错误难以检测、状态连续性难保等核心难题。传统视觉感知受限于像素渲染的非唯一性,导致不同状态可能产生相同图像,难以准确判断任务完成情况。程序状态虽可提供精确信息,但难以高效集成到现有感知驱动模型中。如何在保证感知能力的同时,充分利用程序内部状态,提升任务连续性和验证能力,成为亟待解决的关键问题。
核心创新
本研究提出以程序状态为核心的多智能体架构,区别于传统视觉感知模型。创新点包括:1)状态优先的动作空间,直接操作文件和数据库;2)独立的验证门,基于状态核查任务完成情况;3)上下文管理,保持长时程任务的连续性。系统设计中,主代理专注于状态操作,子代理负责视觉交互,验证门确保结构完整。引入状态外推和任务重入机制,有效缓解信息遗失,提升长时任务的成功率和效率。这些创新突破了感知模型的局限,为自动化代理提供了更稳健的技术基础。
方法详解
- �� 构建以程序状态为核心的多智能体架构,主代理通过持久化文件、DOM和数据库实现任务操作。• 设计状态优先的动作空间,避免像素渲染带来的信息丢失。• 采用独立验证门,利用状态信息核查任务结构和完成情况。• 引入上下文管理,分层存储和压缩任务信息,保证长时程连续性。• 子代理负责视觉交互,仅在必要时调用GUI,减少视觉依赖。• 结合任务计划和重入机制,支持多轮任务修正和验证,确保任务质量。
实验设计
在OSWorld 2.0基准测试中,使用Claude Opus 4.8模型,比较传统视觉驱动与StateAct架构。指标包括二元成功率、部分成功率和任务成本。通过消融实验验证状态操作和验证门的贡献,分析不同递归深度对性能的影响。系统参数设定包括200轮最大交互、子代理最多50轮,确保长时任务的连续性。实验结果显示,StateAct在成功率和成本方面均优于对比方法,验证其有效性。
结果分析
StateAct成功率达26.9%,比传统视觉方法提升6.3个百分点,成本降低九倍,达到7.8美元/任务。部分成功率由54.8%提升至61.6%,在长时任务中表现优异。消融实验显示,去除状态操作导致成功率下降10%以上,验证了状态优先策略的关键作用。系统架构中的验证门显著减少结构性错误,但对价值推理仍有限。整体来看,系统在连续性、鲁棒性和成本效率方面表现优越,为长时自动化任务树立新标杆。
应用场景
该架构适用于企业自动化、软件测试、数据处理等场景,尤其在长时、多步骤任务中表现出色。依赖程序状态的操作方式,要求系统能访问和操作底层数据,适合自动化复杂流程。未来,结合深度推理和学习验证,将推动自主系统在工业、金融、科研等领域实现更广泛应用,提升效率和可信度。
局限与展望
系统在处理高度非结构化内容和复杂推理任务时仍表现有限,验证机制主要针对结构性错误,对价值判断支持不足。长时任务中的递归深度受限,未来需优化子代理策略。此外,系统对计算资源要求较高,需进一步提升效率以适应大规模应用。未来工作将聚焦于增强推理能力和降低成本,推动系统在实际场景中的落地。
通俗解读 非专业人士也能看懂
想象你在厨房做菜,程序状态就像厨房里的食材和工具,而屏幕上的菜谱和图片只是表面。传统方法只看菜谱(像素),可能看不出食材是否新鲜或是否用对调料。而StateAct则直接检查食材和调料的实际状态,比如用手摸一摸、看一看,确保每一步都正确。这样,即使菜谱显示一样,厨师也能知道食材是否新鲜、步骤是否正确。通过这种方式,厨师可以更快、更准确地完成复杂的菜肴,避免因为看错或忘记步骤而出错。这就像用程序状态操作,确保每个环节都在掌控之中,长时间做菜也不会出错。
简单解释 像给14岁少年讲一样
想象你在学校做一个很复杂的科学项目,你得准备很多材料、做实验、写报告。以前的方法就像只看照片,觉得材料都准备好了,但其实你不知道里面的材料是不是新鲜,或者是不是用对量了。现在,像StateAct这样的方法就像你用手去摸、用眼去检查每个材料,确保它们都在正确的位置,内容都是真的。这样,你就能更快、更准地完成项目,不会因为看不见细节而出错。它用一种特别聪明的方式,直接检查事情的“内部状态”,而不是只看表面。这就像你在做科学实验时,亲自确认每一步都正确,而不是只看表面图片一样。这样,整个过程就更可靠,也能做得更长远、更复杂。
原文摘要
Computer-use agents are usually improved by strengthening perception: better models for reading a screenshot and choosing where to click. Yet a screenshot is only a lossy rendering of the underlying program state, e.g., the files, application backends, and DOM that hold the task data. Different states can produce the same pixels, while code can inspect and modify that state directly. StateAct is a code-first, multi-agent harness built around this distinction. Its main agent works directly with program state by using code, while a dedicated GUI subagent handles screenshot-and-click interaction on the few subgoals that need it, just 28 of 108 tasks and 1.1% of main-agent steps. The same direct access to program state also supports verification: an independent finish gate double-checks the saved result for structural failures, e.g., output that is missing, unsaved, or written to the wrong path. To stay on track over hundreds of steps, the main agent hands subgoals to fresh subagents, keeping its own context focused. On OSWorld 2.0, StateAct lifts Claude Opus 4.8 from 20.6% to 26.9% on binary success, and from 54.8% to 61.6% on partial success, at ~ 9x lower cost per task than the same model driven by screenshots alone; a code-only variant with no GUI subagent reaches only 45.9% partial, below that screenshot-based baseline's 54.8%. In general, grounding action, verification, and memory in state, what we call state-grounding, shifts the main bottleneck from perception toward reasoning: failures depend more on what the agent thinks than on what it sees.