K^2-Agent: Co-Evolving Know-What and Know-How for Hierarchical Mobile Device Control

TL;DR

K²-Agent通过分离和共同进化的方式提升移动设备控制,达到76.1%的成功率。

cs.AI 🔴 高级 2026-02-28 8 次浏览
Zhe Wu Donglin Mo Hongjin Lu Junliang Xing Jianheng Liu Yuheng Jing Kai Li Kun Shao Jianye Hao Yuanchun Shi
移动设备控制 层次框架 强化学习 认知模型 任务规划

核心发现

方法论

K²-Agent采用层次化框架,将任务分为“知何”和“知如何”两部分。高层规划器通过SRLR循环自我进化,低层执行器通过C-GRPO算法训练,形成闭环系统。高层从单次演示中提取任务知识,低层通过动态示例注入和错误解耦重放平衡获取技能。

关键结果

  • 在AndroidWorld基准测试中,K²-Agent以76.1%的成功率超越现有开源模型,展示了其在复杂任务中的强大能力。
  • 在ScreenSpot-v2和AitW中,K²-Agent的低层执行器在未见任务上表现出色,验证了其技能的广泛适用性。
  • 消融实验表明,SRLR循环和C-GRPO算法对性能提升至关重要。

研究意义

K²-Agent通过将人类认知模型应用于移动设备控制,解决了长时间规划和精确操作的难题,推动了该领域的研究。其双重泛化能力使其在不同模型和任务上表现出色,具有广泛的应用潜力。

技术贡献

K²-Agent在技术上通过引入SRLR循环和C-GRPO算法,实现了任务知识和技能的分离进化,提供了新的理论保证和工程可能性,与现有方法相比具有显著优势。

新颖性

K²-Agent首次将人类认知中的“知何”和“知如何”分离应用于移动设备控制,提供了一种全新的任务规划和执行框架,与现有方法相比具有根本性创新。

局限性

  • 在某些复杂任务中,K²-Agent可能需要更多的演示以提高成功率。
  • 其性能在极端条件下可能受到硬件限制的影响。

未来方向

未来的研究方向包括扩展K²-Agent到更多的应用场景,优化其在不同硬件上的性能,以及探索更多的任务类型。

AI 总览摘要

现有的移动设备控制代理在处理复杂任务时常常表现不佳,主要是因为缺乏相关的任务经验或不熟悉技能执行。K²-Agent通过分离和共同进化“知何”和“知如何”知识,提供了一种人类认知模型的层次框架。高层规划器通过SRLR循环从单次演示中提取和迭代优化任务级知识,低层执行器通过C-GRPO算法训练,构建一个平衡的样本池并使用动态示例注入指导模型生成成功的轨迹。在AndroidWorld基准测试中,K²-Agent仅使用原始截图和开源骨干网络就实现了76.1%的成功率。此外,K²-Agent展示了强大的双重泛化能力:其高层知识在不同模型间转移,而低层技能在未见任务上表现出色。

深度分析

研究背景

移动设备控制领域的研究一直面临着长时间规划和精确操作的挑战。传统方法通常依赖于大量的手动设计或海量数据和计算资源,难以在复杂任务中取得理想效果。近年来,越来越多的研究开始将推理与行动分离,或采用显式的规划-执行层次结构。

核心问题

现有的移动设备控制方法在处理需要长时间规划和精确操作的复杂任务时表现不佳。这是因为它们通常缺乏相关的任务经验或对技能执行不熟悉,导致任务泛化能力差。

核心创新

K²-Agent的核心创新在于其层次化框架,将任务分为“知何”和“知如何”两部分。通过SRLR循环和C-GRPO算法实现任务知识和技能的分离进化,提供了一种新的任务规划和执行框架。

方法详解

  • �� 高层规划器通过SRLR循环提取任务知识。• 低层执行器通过C-GRPO算法训练,获取技能。• 两者形成闭环系统,通过子目标连接。• 动态示例注入和错误解耦重放平衡提高训练效率。

实验设计

在AndroidWorld基准测试中,K²-Agent仅使用原始截图和开源骨干网络就实现了76.1%的成功率。实验设计包括不同难度的任务,使用多种基线方法进行比较。

结果分析

K²-Agent在AndroidWorld基准测试中以76.1%的成功率超越现有开源模型。其在ScreenSpot-v2和AitW中的表现验证了其技能的广泛适用性。

应用场景

K²-Agent可用于自动化移动设备操作,特别是在需要长时间规划和精确操作的复杂任务中。其双重泛化能力使其在不同模型和任务上表现出色。

局限与展望

K²-Agent在某些复杂任务中可能需要更多的演示以提高成功率。其性能在极端条件下可能受到硬件限制的影响。未来的研究方向包括扩展其应用场景和优化性能。

通俗解读 非专业人士也能看懂

想象一个厨师在厨房里准备一顿复杂的晚餐。厨师需要知道每道菜的配方(“知何”)以及如何烹饪(“知如何”)。K²-Agent就像这个厨师,通过分离和共同进化这两种知识来完成复杂任务。高层规划器就像厨师的脑子,负责计划每道菜的步骤。低层执行器就像厨师的手,通过不断练习来掌握每个步骤的技能。

简单解释 像给14岁少年讲一样

想象你在玩一个需要完成多个任务的手机游戏。你需要知道每个任务的目标是什么(“知何”),还需要知道如何操作手机来完成这些任务(“知如何”)。K²-Agent就像你的游戏助手,帮助你分清任务目标并指导你如何操作。它通过学习和练习,不断提高完成任务的能力。

术语表

K²-Agent

一种用于移动设备控制的层次化框架,分离和共同进化“知何”和“知如何”知识。

K²-Agent通过SRLR循环和C-GRPO算法实现任务规划和执行。

SRLR循环

一种自我进化循环,包括总结、反思、定位和修正四个阶段。

用于高层规划器提取和优化任务知识。

C-GRPO算法

一种用于训练低层执行器的算法,通过错误解耦重放平衡和动态示例注入提高训练效率。

用于低层执行器获取技能。

AndroidWorld

一个用于评估移动设备控制方法的基准测试,包括116个任务。

K²-Agent在此基准测试中实现了76.1%的成功率。

双重泛化

K²-Agent的高层知识和低层技能能够在不同模型和任务上表现出色。

验证了K²-Agent的广泛适用性。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端条件下提高K²-Agent的性能?
  • 2 是否可以将K²-Agent应用于更多的任务类型?

应用场景

近期应用

自动化移动设备操作

K²-Agent可用于自动化复杂的移动设备操作,特别是在需要长时间规划的任务中。

远期愿景

智能助手

K²-Agent可以作为智能助手,帮助用户完成各种复杂的移动设备任务。

原文摘要

Existing mobile device control agents often perform poorly when solving complex tasks requiring long-horizon planning and precise operations, typically due to a lack of relevant task experience or unfamiliarity with skill execution. We propose K2-Agent, a hierarchical framework that models human-like cognition by separating and co-evolving declarative (knowing what) and procedural (knowing how) knowledge for planning and execution. K2-Agent's high level reasoner is bootstrapped from a single demonstration per task and runs a Summarize-Reflect-Locate-Revise (SRLR) loop to distill and iteratively refine task-level declarative knowledge through self-evolution. The low-level executor is trained with our curriculum-guided Group Relative Policy Optimization (C-GRPO), which (i) constructs a balanced sample pool using decoupled reward signals and (ii) employs dynamic demonstration injection to guide the model in autonomously generating successful trajectories for training. On the challenging AndroidWorld benchmark, K2-Agent achieves a 76.1% success rate using only raw screenshots and open-source backbones. Furthermore, K2-Agent shows powerful dual generalization: its high-level declarative knowledge transfers across diverse base models, while its low-level procedural skills achieve competitive performance on unseen tasks in ScreenSpot-v2 and Android-in-the-Wild (AitW).

cs.AI