MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning

TL;DR

提出Iterative Preference Learning(IPL)优化移动代理思考流程,显著提升GUI任务表现。

cs.CL 🔴 高级 2025-05-18 56 次浏览
Kun Huang Weikai Xu Yuxuan Liu Quandong Wang Pengzhi Gao Wei Liu Jian Luan Bin Wang Bo An
人工智能 强化学习 多模态 GUI代理 偏好学习

核心发现

方法论

本文提出基于CoaT树的迭代采样框架,通过Monte Carlo Tree Search(MCTS)构建多路径思考树,利用规则奖励对叶节点评分,并反向传播以生成思考层次的直接偏好优化(T-DPO)对。结合GPT-4o生成多样化指令演化数据,缓解模型过拟合。实验中采用多轮对话与视觉-语言模型(VLM)交互,逐步构建思考树,利用规则奖励评估中间推理步骤,避免昂贵的过程级标注,提升模型的泛化能力。

关键结果

  • 在AITZ、AMEX及AndroidControl三个GUI基准上,MobileIPL均超越OS-ATLAS、UI-TARS等强基线,达成最优性能。具体表现为在AITZ上,MobileIPL的Action Type匹配率达91.73%,比基线提升超过10%;在AMEX上,性能提升3.58%,达70.93%;在AndroidControl中,Step.Acc达72.7%,优于现有SOTA模型Falcon-UI,且在OOD场景中表现出更强的泛化能力。
  • 引入指令演化策略,生成多样化问答对,增强模型对UI布局的理解和推理多样性,显著改善训练样本的多样性和模型鲁棒性。多轮T-DPO训练使模型在有限数据条件下仍实现性能持续提升,验证了方法的高数据效率。
  • 消融实验显示,去除IPL或指令演化会导致性能下降5%以上,验证两者的协同作用。多轮采样与规则奖励的结合,有效提升推理路径的质量和多样性,减少reward hacking现象,增强模型的推理连贯性。

研究意义

该研究突破了GUI代理中中间推理步骤的奖励稀缺瓶颈,提出无需昂贵标注的迭代采样与偏好优化策略,极大提升模型的推理能力和泛化性。其创新的多路径思考树构建机制,为多模态交互任务中的推理优化提供了新思路,推动移动智能代理向更自主、更智能的方向发展。该方法在实际应用中,可显著改善手机自动化操作、智能助手等场景的交互效率与智能水平,具有广泛的产业价值。

技术贡献

本文提出基于CoaT树的迭代采样框架,结合规则奖励和反向传播,生成思考层次的偏好对,避免昂贵的过程标注。引入GPT-4o驱动的指令演化策略,丰富训练样本多样性,增强模型泛化能力。通过多轮T-DPO优化,显著提升多模态GUI任务中的推理质量,超越现有连续预训练模型,展示了在有限标注资源下的高效学习能力。这一技术架构为多路径推理与偏好学习结合提供了新范式。

新颖性

本研究首次在移动GUI代理中引入基于CoaT树的迭代采样机制,结合规则奖励实现无需昂贵中间步骤标注的偏好优化。不同于传统的端到端监督或奖励模型依赖方法,提出的多路径采样与反向奖励传播相结合,显著提高推理路径的多样性和质量。引入GPT-4o的指令演化策略,丰富训练数据,增强模型泛化能力,展现出在有限资源条件下的优越性能。这些创新突破了现有方法在推理多样性和标注成本上的瓶颈。

局限性

  • 当前方法依赖规则奖励,可能在复杂推理场景中难以捕捉细粒度的奖励信号,影响推理精度。
  • 多轮采样和树结构构建带来较高的计算成本,尤其在大规模模型和复杂任务中,存在效率瓶颈。
  • 指令演化策略虽增强多样性,但对GPT-4o的依赖可能限制在特定平台或资源有限环境中的应用推广。

未来方向

未来将探索结合学习型奖励模型(如神经网络驱动的PRM)以提升奖励的表达能力,减少规则依赖。还将优化采样效率,结合强化学习策略,提升大规模场景下的推理速度和准确性。此外,计划扩展到更复杂的多模态任务,结合强化学习与偏好学习的多路径推理机制,推动移动智能代理向更自主、更智能的方向发展。

AI 总览摘要

随着移动设备应用的不断丰富,智能代理在GUI任务中的自主性和推理能力成为研究焦点。传统方法多依赖端到端监督,难以兼顾推理路径的多样性与泛化能力。本文提出的MobileIPL,结合CoaT树的多路径采样和偏好优化策略,有效解决了中间推理步骤奖励稀缺的问题。通过引入GPT-4o驱动的指令演化,丰富训练样本,增强模型的推理多样性和布局理解能力。

在实验中,MobileIPL在AITZ、AMEX及AndroidControl等多个基准上均超越现有最优模型,表现出优异的泛化能力和数据效率。例如,在AITZ上,Action Type匹配率达91.73%,比基线提升超过10%;在AMEX上,性能提升3.58%;在AndroidControl中,Step.Acc达72.7%,优于SOTA模型Falcon-UI。多轮T-DPO训练显著改善推理路径质量,减少reward hacking。

该方法的核心创新在于无需昂贵的中间步骤标注,通过规则奖励和树结构反向传播实现高效采样与优化。引入指令演化策略,增强训练样本多样性,缓解模型过拟合,显著提升推理的多样性和鲁棒性。这一技术架构为多模态推理与偏好学习结合提供了新范式,推动移动智能代理向更自主、更智能的方向发展。未来,将结合学习型奖励模型,优化采样效率,拓展到更复杂的多模态任务,助力智能代理在实际应用中实现更高水平的自主性和智能化。

深度解读

原文摘要

The Chain of Action-Planning Thoughts (CoaT) paradigm has been shown to improve the reasoning performance of VLM-based mobile agents in GUI tasks. However, the scarcity of diverse CoaT trajectories limits the expressiveness and generalization ability of such agents. While self-training is commonly employed to address data scarcity, existing approaches either overlook the correctness of intermediate reasoning steps or depend on expensive process-level annotations to construct process reward models (PRM). To address the above problems, we propose an Iterative Preference Learning (IPL) that constructs a CoaT-tree through interative sampling, scores leaf nodes using rule-based reward, and backpropagates feedback to derive Thinking-level Direct Preference Optimization (T-DPO) pairs. To prevent overfitting during warm-up supervised fine-tuning, we further introduce a three-stage instruction evolution, which leverages GPT-4o to generate diverse Q\&A pairs based on real mobile UI screenshots, enhancing both generality and layout understanding. Experiments on three standard Mobile GUI-agent benchmarks demonstrate that our agent MobileIPL outperforms strong baselines, including continual pretraining models such as OS-ATLAS and UI-TARS. It achieves state-of-the-art performance across three standard Mobile GUI-Agents benchmarks and shows strong generalization to out-of-domain scenarios.

cs.CL cs.AI