ProactiveMobile: A Comprehensive Benchmark for Boosting Proactive Intelligence on Mobile Devices

TL;DR

ProactiveMobile是一个提升移动设备主动智能的综合基准,Qwen2.5-VL-7B-Instruct成功率达20.82%。

cs.AI 🔴 高级 2026-02-25 22 次浏览
Dezhi Kong Zhengzhao Feng Qiliang Liang Hao Wang Haofei Sun Changpeng Yang Yang Li Peng Zhou Shuai Nie Hongzhen Wang Linfeng Zhou Hao Jia Jiaming Xu Runyu Shi Ying Huang
主动智能 移动设备 多模态 基准测试 API

核心发现

方法论

ProactiveMobile通过分析设备上的四维上下文信号来推断用户潜在意图,并从63个API的函数池中生成可执行的函数序列。该基准包含3660个实例,涵盖14个场景,采用多答案注释以反映现实复杂性。

关键结果

  • Qwen2.5-VL-7B-Instruct在精确函数序列匹配上取得了20.82%的成功率,显著优于o1的17.02%和GPT-5的11.37%。
  • 实验表明,当前的多模态大语言模型在主动性方面普遍缺乏,但通过专门训练可以提高。
  • 基准测试揭示了主动智能的挑战性,强调了ProactiveMobile的重要性。

研究意义

ProactiveMobile为主动智能研究提供了一个系统化的评估框架,填补了现有基准过于简单化的空白。通过多答案注释和可执行函数序列的生成,该基准为研究人员提供了更具挑战性和现实性的测试环境,有助于推动移动代理从被动执行向主动协作的转变。

技术贡献

ProactiveMobile通过引入多维上下文信号和可执行函数序列,提供了一个新的任务形式化方法。与现有方法相比,该基准强调了多答案注释和功能正确性的重要性,推动了主动智能领域的技术进步。

新颖性

ProactiveMobile首次将主动任务形式化为多维上下文信号的推断,并通过63个API的函数池生成可执行序列,突破了现有基准的单一答案限制。

局限性

  • 当前模型在设备上的部署性能仍未达到要求,表明主动智能的实现具有挑战性。
  • 基准测试的复杂性可能导致模型在处理多答案注释时出现困难。

未来方向

未来研究可以探索更高效的模型训练方法,以提高主动智能的性能。此外,可以扩展基准测试的场景和API池,以涵盖更广泛的应用领域。

AI 总览摘要

ProactiveMobile是一个旨在提升移动设备主动智能的综合基准。现有的多模态大语言模型(MLLMs)主要在反应性范式中运作,限制了其在日常生活中的无缝集成。ProactiveMobile通过引入多维上下文信号和可执行函数序列,提供了一个新的任务形式化方法,填补了现有基准过于简单化的空白。

该基准包含3660个实例,涵盖14个场景,采用多答案注释以反映现实复杂性。实验结果表明,经过微调的Qwen2.5-VL-7B-Instruct在精确函数序列匹配上取得了20.82%的成功率,显著优于o1和GPT-5。这表明,主动性是一种需要专门训练的能力,强调了ProactiveMobile在主动性评估中的重要性。

尽管取得了显著进展,当前模型在设备上的部署性能仍未达到要求,表明主动智能的实现具有挑战性。未来研究可以探索更高效的模型训练方法,并扩展基准测试的场景和API池,以涵盖更广泛的应用领域。

深度分析

研究背景

近年来,多模态大语言模型(MLLMs)在移动代理的发展中取得了显著进展。然而,这些模型主要局限于反应性范式,仅执行用户的明确命令。这种限制阻碍了移动代理在日常生活中的无缝集成,推动了向主动智能的转变。主动智能的核心在于代理能够自主预测用户需求并采取行动,从而减轻用户的认知负担。

核心问题

现有的基准测试过于简单化,通常假设每个场景只有一个“正确”的动作。这忽视了用户偏好的多样性和主观性,导致复杂的多对一映射被简化为不切实际的一对一范式。此外,现有的评估指标难以区分部分失败和完全失败,输出格式也缺乏可执行性。

核心创新

ProactiveMobile通过引入多维上下文信号和可执行函数序列,提供了一个新的任务形式化方法。该基准强调多答案注释和功能正确性,允许每个实例有一到三个目标动作。这种方法将评估从主观的文本匹配问题转变为客观的结构化任务。

方法详解

  • �� 分析设备上的四维上下文信号:用户档案、设备状态、世界信息和行为轨迹。
  • �� 生成可执行函数序列:从63个API的函数池中选择。
  • �� 多答案注释:每个实例有一到三个目标动作。
  • �� 三阶段审核机制:确保数据的可靠性和准确性。

实验设计

实验使用ProactiveMobile基准测试,评估了多种模型的性能,包括微调的Qwen2.5-VL-7B-Instruct和MiMo-VL-7B-SFT-2508。实验结果表明,Qwen2.5-VL-7B-Instruct在精确函数序列匹配上取得了20.82%的成功率,显著优于其他模型。

结果分析

实验结果表明,经过微调的Qwen2.5-VL-7B-Instruct在精确函数序列匹配上取得了20.82%的成功率,显著优于o1和GPT-5。这表明,主动性是一种需要专门训练的能力,强调了ProactiveMobile在主动性评估中的重要性。

应用场景

ProactiveMobile可以用于评估和提升移动设备上的主动智能,适用于需要自主预测用户需求并采取行动的应用场景,如智能家居、个人助理等。

局限与展望

当前模型在设备上的部署性能仍未达到要求,表明主动智能的实现具有挑战性。此外,基准测试的复杂性可能导致模型在处理多答案注释时出现困难。

通俗解读 非专业人士也能看懂

想象你有一个非常聪明的助手,它不仅能听懂你的指令,还能提前知道你需要什么。比如,当你走进厨房时,它已经为你准备好了咖啡,因为它知道你每天早上都喝咖啡。这就是ProactiveMobile的工作原理。它通过分析你的习惯和环境,预测你的需求,然后采取行动。这种主动性让生活变得更加轻松,因为你不再需要每次都告诉助手该做什么。

简单解释 像给14岁少年讲一样

想象一下,你有一个超级智能的手机助手。它不仅能听懂你说的话,还能提前知道你想要什么。比如,你放学回家,它已经帮你打开了你最喜欢的游戏,因为它知道你每天这个时候都会玩。这个助手就像一个无形的朋友,总是在你需要的时候帮你。ProactiveMobile就是这样一个系统,它让手机助手变得更聪明,更懂你。

术语表

多模态大语言模型 (MLLMs)

结合多种数据类型(如文本、图像)的语言模型,用于理解和生成自然语言。

用于移动代理的发展,以提升其理解和执行复杂任务的能力。

主动智能

系统能够自主预测用户需求并采取行动的能力。

ProactiveMobile通过多维上下文信号实现主动智能。

函数池

一组预定义的可执行函数,用于将用户意图转化为具体操作。

ProactiveMobile使用63个API的函数池生成可执行序列。

多答案注释

每个实例允许多个正确答案的注释方式,反映用户偏好的多样性。

用于ProactiveMobile基准测试中的实例注释。

精确函数序列匹配

模型输出的函数序列与基准测试中的目标序列完全一致。

用于评估模型在ProactiveMobile上的性能。

开放问题 这项研究留下的未解疑问

  • 1 如何提高模型在多答案注释下的处理能力,仍需进一步研究。
  • 2 现有模型在设备上的部署性能不足,需探索更高效的训练方法。

应用场景

近期应用

智能家居

通过预测用户的日常习惯,自动调整家居设备,提高生活便利性。

远期愿景

个人助理

开发能自主处理复杂任务的个人助理,减少用户的认知负担。

原文摘要

Multimodal large language models (MLLMs) have made significant progress in mobile agent development, yet their capabilities are predominantly confined to a reactive paradigm, where they merely execute explicit user commands. The emerging paradigm of proactive intelligence, where agents autonomously anticipate needs and initiate actions, represents the next frontier for mobile agents. However, its development is critically bottlenecked by the lack of benchmarks that can address real-world complexity and enable objective, executable evaluation. To overcome these challenges, we introduce ProactiveMobile, a comprehensive benchmark designed to systematically advance research in this domain. ProactiveMobile formalizes the proactive task as inferring latent user intent across four dimensions of on-device contextual signals and generating an executable function sequence from a comprehensive function pool of 63 APIs. The benchmark features over 3,660 instances of 14 scenarios that embrace real-world complexity through multi-answer annotations. To ensure quality, a team of 30 experts conducts a final audit of the benchmark, verifying factual accuracy, logical consistency, and action feasibility, and correcting any non-compliant entries. Extensive experiments demonstrate that our fine-tuned Qwen2.5-VL-7B-Instruct achieves a success rate of 19.15%, outperforming o1 (15.71%) and GPT-5 (7.39%). This result indicates that proactivity is a critical competency widely lacking in current MLLMs, yet it is learnable, emphasizing the importance of the proposed benchmark for proactivity evaluation.

cs.AI