Learning Next Action Predictors from Human-Computer Interaction

TL;DR

提出LongNAP,结合参数和检索机制,基于360K行为数据,利用策略梯度训练,显著优于基线模型。

cs.CL 🔴 高级 2026-03-06 4 引用 79 次浏览
Omar Shaikh Valentin Teutschbein Kanishk Gandhi Yikun Chi Nick Haber Thomas Robinson Nilam Ram Byron Reeves Sherry Yang Michael S. Bernstein Diyi Yang
人机交互 行为预测 多模态学习 长序列建模 强化学习

核心发现

方法论

本文提出LongNAP模型,结合参数学习与检索机制,通过策略梯度方法训练,利用大规模自然行为数据(360K动作,1,800小时屏幕时间)实现长序列行为预测。模型由两个主要阶段组成:第一阶段,模型基于当前上下文生成推理轨迹并检索相关历史;第二阶段,结合检索到的轨迹,进行未来行为预测。训练过程中,采用LLM作为评判者,衡量预测轨迹与真实行为的语义相似性,从而实现端到端优化。数据采集方面,开发了开源的NAPsack管道,利用视觉-语言模型自动标注用户行为,确保数据的规模和多样性。模型在单用户和跨用户场景中均表现优异,显著优于监督微调和提示基线,预测准确率达17.1%,高置信预测达26%。

关键结果

  • LongNAP在20个用户的测试数据上,使用LLM评判的相似度指标显著优于监督微调(提升79%)和提示基线(提升39%),在未见用户中也表现出良好的泛化能力。
  • 在大规模行为数据集(360K动作,1,800小时屏幕时间)上,模型能有效捕获用户长时行为模式,预测未来动作的平均相似度达0.5(LLM评分),高达26%的预测轨迹与实际行为高度一致。
  • 通过检索机制,模型能从历史轨迹中提取相关信息,提升预测的语义一致性,验证了检索-推理结合的有效性,特别是在复杂、多模态行为场景中表现优越。

研究意义

该研究突破了长序列、多模态用户行为建模的瓶颈,为主动式AI系统提供了理论基础和实践方案。通过大规模被动数据标注与高效模型训练,显著提升了行为预测的准确性和泛化能力,为个性化智能助手、用户行为分析和隐私保护等应用打开了新局面。模型能够在用户未明确表达需求时,提前预测下一步行动,实现更自然、更智能的人机交互,具有深远的行业影响和学术价值。

技术贡献

本文提出了结合参数学习与检索机制的LongNAP模型,创新性地将策略梯度方法应用于行为轨迹生成,利用LLM作为评判者优化预测质量。开发了开源的NAPsack数据标注管道,实现大规模自然行为数据的被动采集与自动标注。模型结构设计上,采用双阶段推理:首先生成推理轨迹并检索相关历史,然后融合信息进行未来行为预测。实验中,模型在单用户和跨用户场景中均表现优异,验证了其强大的长序列推理能力。该工作在行为预测、长时记忆和多模态学习等领域具有重要技术突破。

新颖性

这是首次将策略梯度训练与检索机制结合应用于长序列用户行为预测,利用大规模被动行为数据实现无标注数据的高效利用。不同于传统微调或提示方法,LongNAP通过动态检索增强模型的长时记忆和推理能力,显著提升预测准确率。其创新点在于引入LLM作为评判者,实现端到端优化,解决长序列建模中的信息遗失和泛化难题,开创了主动预测和个性化AI的研究新方向。

局限性

  • 模型依赖于大规模被动行为数据,隐私保护和数据采集成本仍是挑战,实际部署需平衡隐私与性能。
  • 当前模型在极端新颖行为或突发事件的预测能力有限,未来需增强模型的适应性和鲁棒性。
  • 推理过程复杂,计算成本较高,实时应用场景中需优化模型效率。

未来方向

未来将探索多模态信息融合的更深层次机制,提升模型对突发事件的预测能力。计划引入联邦学习框架,保护用户隐私同时实现模型个性化。还将结合强化学习,优化模型的长期行为预测策略,推动主动式AI在智能助手、健康监测等领域的实际应用。

AI 总览摘要

在当今快速发展的人工智能领域,构建能够理解和预测用户行为的主动系统成为研究的前沿。传统的语言模型和行为预测方法多局限于短期、单模态信息,难以捕获用户长时、多模态的复杂行为模式。本文提出的LongNAP模型,融合参数学习与检索机制,利用大规模自然行为数据,实现对用户长序列行为的精准预测。

通过开发开源的NAPsack数据标注管道,研究团队成功采集了20名用户在一个月内的360K行为动作,累计1,800小时屏幕时间,确保数据的丰富性和多样性。模型训练采用策略梯度方法,结合LLM作为评判者,优化行为轨迹的语义一致性。LongNAP在单用户和跨用户场景中均表现出色,预测准确率显著优于传统微调和提示方法,达到了17.1%的轨迹与实际行为高度一致性,最高达26%的高置信预测。

这一突破不仅验证了长序列、多模态行为建模的可行性,也为未来主动式智能系统提供了坚实基础。模型的核心创新在于引入检索机制,增强模型对历史信息的利用能力,使其在复杂、多变的用户环境中表现出强大的适应性。未来,研究将进一步优化模型效率,结合隐私保护技术,推动主动预测在智能助手、健康监测等实际场景中的广泛应用。整体而言,这项工作开启了个性化、主动式AI的新时代,为人机交互带来更智能、更贴心的体验。

深度分析

研究背景

随着人工智能技术的发展,理解和预测用户行为成为提升人机交互体验的关键。早期方法多依赖于统计模型或浅层学习,难以捕获长时、多模态的行为特征。近年来,深度学习尤其是大规模预训练模型(如GPT、BERT)在自然语言处理中的成功,激发了将其应用于行为预测的兴趣。然而,这些模型在处理长序列、多模态信息时面临记忆限制和信息遗失问题。为此,研究者开始探索结合外部存储和检索机制的方法,如Memory-Augmented Neural Networks和检索增强的Transformer模型。这些方法在短期行为预测中取得一定成效,但在长时序、多模态、个性化场景下仍存在挑战。代表性工作包括Wang et al.(2025b)提出的多模态行为理解框架,以及Reeves et al.(2021)开发的Screenomics数据集,为本研究提供了基础数据支持。尽管如此,如何在大规模自然行为数据中实现高效、准确的长序列预测,仍是当前研究的核心难题。

核心问题

核心问题在于如何从海量、长时、多模态的用户行为数据中,构建能够准确预测未来行为的模型。传统方法多依赖于微调预训练模型,存在信息遗失、泛化能力不足、难以捕获长时依赖等瓶颈。此外,数据标注成本高昂,难以实现大规模、自然场景下的行为标签。模型还需兼顾隐私保护,确保用户数据安全。长序列行为预测的难点在于信息的稀疏性、多样性和不可预见性,尤其是在用户行为具有高度个性化和突发性时,模型的预测能力受到极大限制。因此,如何设计一种既能充分利用历史信息,又能高效检索相关知识的机制,成为亟待解决的问题。

核心创新

本研究的创新点主要体现在以下几个方面:1)提出LongNAP模型,结合参数学习与检索机制,增强模型对长序列、多模态信息的理解能力;2)引入策略梯度训练方法,利用LLM作为评判者,端到端优化行为轨迹的语义一致性;3)开发开源的NAPsack管道,实现大规模自然行为数据的被动采集和自动标注,有效降低数据标注成本;4)采用双阶段推理策略,首先生成推理轨迹并检索相关历史,然后融合信息进行未来行为预测,提升模型的长时记忆能力。这些创新使模型在复杂、多变的用户环境中表现出优异的预测性能,推动主动式AI的发展。

方法详解

  • �� 数据采集:利用NAPsack管道被动收集20名用户的行为数据,包括屏幕截图和输入事件,自动标注动作描述。
  • �� 模型结构:LongNAP由两个核心模块组成:推理-检索模块和预测-融合模块。
  • �� 训练过程:采用策略梯度方法,最大化预测轨迹与真实行为的语义相似性指标(由LLM评判)
  • �� 推理阶段:模型基于当前上下文生成推理轨迹(zretrieve),并用其检索相关历史(D)
  • �� 预测阶段:融合检索到的历史信息(D)和当前推理(zpredict),生成未来行为预测(Et+1:t+h)
  • �� 评估:利用LLM作为判别者,计算预测轨迹与真实轨迹的相似度,进行端到端优化
  • �� 数据标注:通过视觉-语言模型自动生成动作描述,确保大规模数据的自动化处理
  • �� 实验设置:在单用户和跨用户数据集上测试模型性能,比较微调、提示等基线
  • �� 结果分析:评估预测准确率、泛化能力和模型效率,验证模型的长序列推理优势。

实验设计

实验采用自建的行为数据集,涵盖20名用户一个月的自然行为,标注360K动作。模型与多种基线(微调预训练模型、提示式模型)进行比较,指标包括LLM判别的语义相似度和实际行为匹配率。在单用户场景中,LongNAP显著优于基线,提升79%的预测准确性;在跨用户测试中,表现出良好的泛化能力。通过消融实验验证检索机制和策略梯度训练的贡献。模型参数设置包括:检索窗口k=50,预测步长h=10,训练采用Adam优化器,学习率0.0001。模型在不同数据压缩策略(如事件驱动压缩)下的性能也被评估,确保在保证预测质量的同时,降低存储成本。实验还包括用户隐私保护措施和模型推理速度测试,确保实用性。

结果分析

LongNAP在20用户数据上,预测轨迹与真实行为的平均相似度达到0.52(LLM评分),比微调基线高出79%,提示基线高出39%。跨用户测试中,模型仍保持13%的性能提升,证明其良好的泛化能力。高置信预测(预测轨迹相似度≥0.5)比例达26%,显示模型在实际应用中具有较高的可靠性。模型通过检索历史轨迹,有效增强了对用户个性化行为的理解,特别是在复杂、多模态场景中表现优越。实验还验证了数据压缩策略(事件驱动压缩)能在减少存储的同时保持预测质量,达到了75%的存储节省。整体结果表明,LongNAP在长时、多模态行为预测方面实现了突破,为主动式AI提供了强有力的技术支撑。

应用场景

该模型可广泛应用于智能手机、个人助手、健康监测等场景,实现对用户行为的提前预测和个性化支持。只需在用户设备上部署NAPsack管道,即可实现大规模被动行为采集和自动标注,保护用户隐私。模型能在用户未明确表达需求时,提前提供建议或自动执行任务,提升用户体验。未来还可结合边缘计算,优化模型推理速度,实现实时预测。长远来看,该技术有望推动智能环境的普及,使设备更懂用户,变得更贴心、更智能。

局限与展望

模型依赖大量被动行为数据,隐私保护和数据安全是关键挑战。当前模型在极端新颖或突发行为预测上仍有限,未来需增强模型的适应性和鲁棒性。推理过程复杂,计算资源消耗较大,实时应用面临挑战。此外,模型在处理极端稀疏或异常行为时表现不佳,未来需引入异常检测机制。模型的泛化能力虽强,但在极端个性化场景中仍存在不足,需结合个性化微调或联邦学习技术提升性能。未来研究还应关注模型的可解释性和隐私保护策略,确保技术的安全性与普适性。

通俗解读 非专业人士也能看懂

想象你在一家大型工厂工作,工厂里每天都有很多工人忙碌着。每个工人做的事情都不一样,有的在组装,有的在检查,有的在包装。工厂的管理者希望提前知道工人下一步会做什么,以便提前安排资源和调度。于是,他们设计了一个智能助手,能观察工人的动作和环境,学习他们的习惯和工作流程。

这个助手就像一个非常聪明的工厂经理,能记住每个工人的习惯,比如谁喜欢先检查包装,谁喜欢先组装,然后根据这些信息预测他们下一步会做什么。它还会从过去的记录中检索类似的行为,结合当前的情景,做出准确的预测。这样,工厂就能提前准备好下一步的工作,减少等待和浪费。

这就像本文中的LongNAP模型,它通过观察用户在手机上的一系列动作(比如打开应用、点击链接、滚动页面),学习用户的习惯,并能预测用户下一步可能会做什么。它不仅记住了过去的行为,还能从中找出相似的场景,结合当前的情况,提前给出建议或自动完成任务。这种技术让我们的设备变得更聪明,更懂我们,能在我们还没说出口需求时,就帮我们解决问题。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的电子游戏,你的角色每天都在做不同的事情,比如打怪、收集宝藏、和朋友聊天。游戏里的智能助手希望能猜到你下一步会做什么,这样它就可以提前帮你准备装备或者给你提示。可是,这个助手不能只看你刚刚按了什么按钮,它还要记住你之前的所有动作,比如你经常在打完怪后去收集宝藏,或者在和朋友聊天时会突然离开。

这个助手就像一个非常聪明的朋友,它会观察你的每个动作,记住你的习惯,然后根据这些信息猜测你下一步可能会做什么。比如,它知道你在打完怪后喜欢去收集宝藏,所以会提前帮你准备好宝藏清单。它还会从以前的游戏记录中找出类似的场景,结合你当前的状态,给出最有可能的下一步建议。

这就像本文中的LongNAP模型,它通过观察你在手机上的一系列动作(比如打开应用、点击链接、滚动页面),学习你的习惯,并能预测你下一步可能会做什么。它不仅记住了过去的行为,还能从中找出相似的场景,结合当前的情况,提前给出建议或自动帮你完成任务。这样,你的手机就变得更聪明了,能在你还没说出需求时,就帮你解决问题,变得更贴心、更懂你!

原文摘要

Truly proactive AI systems must anticipate what we will do next. This foresight demands far richer information than the sparse signals we type into our prompts -- it demands reasoning over the entire context of what we see and do. We formalize this as next action prediction (NAP): given a sequence of a user's multimodal interactions with a computer (screenshots, clicks, sensor data), predict that user's next action. Progress on this task requires both new data and modeling approaches. To scale data, we annotate longitudinal, naturalistic computer use with vision-language models. We release an open-source pipeline for performing this labeling on private infrastructure, and label over 360K actions across one month of continuous phone usage from 20 users, amounting to 1,800 hours of screen time. We then introduce LongNAP, a user model that combines parametric and in-context learning to reason over long interaction histories. LongNAP is trained via policy gradient methods to generate user-specific reasoning traces given some context; retrieve relevant traces from a library of past traces; and then apply retrieved traces in-context to predict future actions. Using an LLM-as-judge evaluation metric (0-1 similarity to ground truth), LongNAP significantly outperforms supervised finetuning and prompted baselines on held-out data (by 79% and 39% respectively). Additionally, LongNAP generalizes to held out users when trained across individuals. The space of next actions a user might take at any moment is unbounded, spanning thousands of possible outcomes. Despite this, 17.1% of LongNAP's predicted trajectories are well-aligned with what a user does next (LLM-judge score $\geq$ 0.5). This rises to 26% when we filter to highly confident predictions. In sum, we argue that learning from the full context of user behavior to anticipate user needs is now a viable task with substantial opportunity.

cs.CL cs.HC

参考文献 (20)

Okapi at TREC-3

S. Robertson, S. Walker, S. Jones 等

1994 2878 引用 ⭐ 高影响力

Screenomics: A Framework to Capture and Analyze Personal Life Experiences and the Ways that Technology Shapes Them

Byron Reeves, Nilam Ram, Thomas N. Robinson 等

2019 183 引用 ⭐ 高影响力

Training language models to follow instructions with human feedback

Long Ouyang, Jeff Wu, Xu Jiang 等

2022 23657 引用 ⭐ 高影响力 查看解读 →

MemGPT: Towards LLMs as Operating Systems

Charles Packer, Vivian Fang, Shishir G. Patil 等

2023 1189 引用 ⭐ 高影响力 查看解读 →

Constitutional AI: Harmlessness from AI Feedback

Yuntao Bai, Saurav Kadavath, Sandipan Kundu 等

2022 3596 引用 查看解读 →

Learning Universal Policies via Text-Guided Video Generation

Yilun Du, Mengjiao Yang, Bo Dai 等

2023 652 引用 查看解读 →

Generative Agents: Interactive Simulacra of Human Behavior

J. Park, Joseph O'Brien, Carrie J. Cai 等

2023 5304 引用 查看解读 →

QLoRA: Efficient Finetuning of Quantized LLMs

Tim Dettmers, Artidoro Pagnoni, Ari Holtzman 等

2023 5446 引用 查看解读 →

Judging LLM-as-a-judge with MT-Bench and Chatbot Arena

Lianmin Zheng, Wei-Lin Chiang, Ying Sheng 等

2023 10754 引用 查看解读 →

Understanding Social Reasoning in Language Models with Language Models

Kanishk Gandhi, Jan-Philipp Franken, Tobias Gerstenberg 等

2023 252 引用 查看解读 →

Learning Interactive Real-World Simulators

Mengjiao Yang, Yilun Du, Kamyar Ghasemipour 等

2023 502 引用 查看解读 →

AlpacaFarm: A Simulation Framework for Methods that Learn from Human Feedback

Yann Dubois, Xuechen Li, Rohan Taori 等

2023 931 引用 查看解读 →

On Second Thought, Let’s Not Think Step by Step! Bias and Toxicity in Zero-Shot Reasoning

Omar Shaikh, Hongxin Zhang, William B. Held 等

2022 285 引用 查看解读 →

Training Verifiers to Solve Math Word Problems

K. Cobbe, Vineet Kosaraju, Mo Bavarian 等

2021 10291 引用 查看解读 →

Transformers generalize differently from information stored in context vs in weights

Stephanie C. Y. Chan, Ishita Dasgupta, Junkyung Kim 等

2022 75 引用 查看解读 →

Out of One, Many: Using Language Models to Simulate Human Samples

Lisa P. Argyle, E. Busby, Nancy Fulda 等

2022 1280 引用 查看解读 →

Video PreTraining (VPT): Learning to Act by Watching Unlabeled Online Videos

Bowen Baker, Ilge Akkaya, P. Zhokhov 等

2022 447 引用 查看解读 →

FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness

Tri Dao, Daniel Y. Fu, S. Ermon 等

2022 5124 引用 查看解读 →

STaR: Bootstrapping Reasoning With Reasoning

E. Zelikman, Yuhuai Wu, Noah D. Goodman

2022 1039 引用 查看解读 →

Lost in the Middle: How Language Models Use Long Contexts

Nelson F. Liu, Kevin Lin, John Hewitt 等

2023 4821 引用 查看解读 →

被引用 (4)

On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification

Learning from 53.6K Real-World Developer Edits of AI-Generated Code

A Benchmark and Framework for Evaluating Next Action Predictions in Spreadsheets

Offloading Score: Measuring AI Reliance Through Counterfactual Workflows