User Preference Modeling for Conversational LLM Agents: Weak Rewards from Retrieval-Augmented Interaction

TL;DR

提出VARS框架,通过在线弱奖励学习用户双向向量,提升多会话个性化交互效率。

cs.CL 🔴 高级 2026-03-22 24 次浏览
Yuren Hao Shuhaib Mehri ChengXiang Zhai Dilek Hakkani-Tür
对话系统 个性化 信息检索 强化学习 用户建模

核心发现

方法论

VARS采用冻结的预训练大模型架构,结合偏好提取模型、偏好记忆库和双向用户向量,通过弱标量奖励在线更新用户偏好向量。偏好提取模型基于Qwen3-0.6B,提取条件-动作对,偏好记忆存储偏好卡片,偏好向量包括长期和短期两个分量,利用REINFORCE算法进行在线更新。偏好检索通过密集搜索和重排序,结合用户偏好向量偏置,提升相关偏好召回。系统在MULTISESSIONCOLLAB基准上评估,涵盖数学和代码任务,验证了个性化偏好建模在提升交互效率方面的优势。

关键结果

  • VARS在成功率、超时率和用户努力方面优于多种基线,成功率达55.2%,超时率26.4%,用户tokens平均193.6,较Reflection基线提升0.8个百分点,显著降低用户交互成本。
  • 在多任务环境中,VARS显著减少超时和用户努力,交互效率提升8.4%,在任务成功率与反思基线持平,验证了偏好向量在个性化中的作用。
  • 偏好向量分析显示,长期向量与跨用户偏好重叠度高,短期向量反映会话内的即时适应,支持双向向量设计的可解释性。

研究意义

该研究突破了大模型在多会话场景中的个性化瓶颈,提出无需微调即可在线学习用户偏好,显著提升交互效率,解决了传统方法在持续个性化中的数据和计算成本问题,为智能助手的个性化发展提供新思路,具有广泛的学术和工业应用潜力。

技术贡献

提出基于弱奖励的在线偏好向量学习机制,结合偏好提取、偏好记忆和偏好偏置重排序,创新性地实现了无微调的用户个性化。理论上,证明了偏好向量的梯度更新对应固定目标的梯度,支持多尺度偏好建模。工程上,构建了端到端的偏好学习与检索系统,兼容多种大模型架构,提升了个性化的可扩展性与解释性。

新颖性

首次在对话系统中引入双向偏好向量,通过弱奖励实现持续在线学习,无需微调模型参数,区别于以往依赖静态用户配置或微调的方案。该方法结合偏好记忆和偏好偏置,提供更细粒度的个性化控制,具有较强的创新性。

局限性

  • 系统依赖于偏好提取模型的准确性,偏差可能导致偏好偏置错误,影响个性化效果。
  • 偏好向量的更新受奖励信号噪声影响,可能引入偏差,需进一步优化奖励机制。
  • 在极端偏好变化或多样性极高的用户场景中,偏好模型的适应性仍有限,未来需增强鲁棒性。

未来方向

未来将探索多模态偏好建模,结合用户行为和情感信息,提升偏好表示的丰富性;同时优化偏好记忆管理策略,增强系统在极端场景下的适应能力,推动个性化对话系统的普及与智能化。

AI 总览摘要

在智能对话系统快速发展的背景下,个性化用户建模成为提升交互效率的关键。传统方法多依赖静态用户配置或微调模型,成本高且难以动态适应用户偏好变化。本文提出VARS(Vector-Adapted Retrieval Scoring)框架,通过引入双向用户偏好向量,结合弱奖励机制,实现无微调的持续在线个性化。系统由偏好提取模型、偏好记忆库和偏好偏置重排序三大核心组成,利用强化学习算法(REINFORCE)在线更新用户偏好向量,增强偏好相关偏好召回能力。在多会话基准MULTISESSIONCOLLAB上,VARS显著优于多种基线模型,不仅提升了交互效率(成功率55.2%,超时率26.4%),还降低了用户交互成本(平均用户tokens193.6)。偏好向量分析显示,长期向量反映跨会话稳定偏好,短期向量捕捉会话内即时变化,验证了双向设计的可解释性。该方法突破了传统个性化的瓶颈,为大模型在多轮、多任务场景中的持续个性化提供了新思路,具有广泛的学术和工业应用前景。未来,结合多模态信息和优化偏好记忆管理,将进一步推动个性化对话系统的智能化和普及。

深度分析

研究背景

随着大规模预训练语言模型(如GPT、BERT)的兴起,对话系统逐渐向智能化、个性化方向发展。早期方法多依赖静态用户配置或微调模型参数,存在成本高、适应性差的问题。近年来,研究者尝试通过记忆增强、反思机制和偏好建模提升个性化效果,如Zhong等(2024)提出的记忆检索方法,Sarin等(2025)引入的多模态记忆架构。尽管如此,这些方法多依赖存储历史对话或静态偏好,难以实现持续、动态的个性化。多会话建模成为研究热点,Mehri等(2026)提出的MULTISESSIONCOLLAB基准,为评估长时偏好建模提供了平台。现有技术多依赖静态偏好或微调,难以应对偏好变化和个性差异,亟需一种高效、动态的个性化机制。

核心问题

核心问题在于如何在无需微调模型参数的情况下,持续学习用户偏好,并在多轮对话中动态调整偏好召回策略。传统方法多依赖静态偏好配置或存储历史,缺乏对偏好变化的敏感性,导致个性化效果有限。此外,如何在保证模型冻结的基础上,通过少量弱奖励实现偏好向量的有效更新,也是技术难点。解决这一问题对于提升对话系统的用户满意度和交互效率具有重要意义,尤其是在多会话、多任务环境中,偏好变化频繁,系统需具备良好的适应能力。

核心创新

本研究的创新点包括:1)引入双向偏好向量(长期与短期)结构,有效区分跨会话稳定偏好与会话内即时偏好,增强模型的可解释性和适应性;2)利用弱奖励(如用户反馈关键词、话题一致性)在线更新偏好向量,无需微调模型参数,降低成本;3)结合偏好提取、偏好记忆和偏好偏置重排序,形成端到端的个性化检索机制,显著提升交互效率。这些创新突破了现有静态偏好模型的局限,为持续个性化提供了新途径。

方法详解

  • �� 偏好提取:利用微调的Qwen3-0.6B模型,将对话内容转化为结构化条件-动作偏好卡片。• 偏好记忆:存储偏好卡片,包含偏好条件、备注、嵌入向量,区分全局与条件偏好。• 用户向量:将偏好嵌入映射到共享空间,构建长期(z(L)U)和短期(z(S)U,t)两个偏好向量,长期向量累积跨会话偏好,短期向量实时更新。• 召回偏好:通过密集搜索偏好记忆,结合偏好偏置(由用户向量调节)重排序,优先展示相关偏好。• 在线更新:利用用户反馈关键词和话题相似度,估算弱奖励,采用REINFORCE算法调整偏好向量,动态适应用户偏好变化。

实验设计

在MULTISESSIONCOLLAB基准上,采用60个用户模型,进行60轮会话,评估成功率、超时率和用户努力指标。对比多种基线(Vanilla、Contextual、Reflection、RAG),验证VARS在提升交互效率和降低用户成本方面的优越性。参数设置包括偏好提取模型微调、偏好记忆容量和偏好偏置调节系数,进行消融分析以验证各部分贡献。通过统计检验确保结果显著,分析偏好向量的稳定性和跨用户一致性。

结果分析

VARS在成功率方面达55.2%,优于Reflection(54.4%)和RAG(52.0%),超时率26.4%,低于Reflection(28.8%),用户tokens平均193.6,较Reflection减少13.9。交互效率提升8.4%,偏好向量分析显示长期向量与偏好重叠度高,短期向量反映会话内变化,验证了双向偏好建模的有效性。

应用场景

该方法适用于智能助手、教育辅导、企业客服等场景,能实现个性化推荐、偏好适应和持续学习。系统只需在模型冻结基础上增加偏好偏置和记忆机制,便于部署到现有大模型架构中,提升用户满意度和交互效率。未来可结合多模态信息,增强偏好表示的丰富性,推动个性化服务的智能化发展。

局限与展望

当前偏好提取模型在复杂偏好表达下可能存在误差,弱奖励信号易受噪声影响,偏好向量在极端偏好变化时适应性不足。此外,偏好记忆容量有限,长时间交互可能导致偏好偏置偏差积累,未来需优化偏好管理策略和奖励机制,增强系统鲁棒性。

通俗解读 非专业人士也能看懂

想象你在一家厨房里做饭。每次做菜,你会根据不同的食材、口味偏好调整调料的用量和烹饪方式。厨师(系统)希望记住你的偏好,比如喜欢辣一点或少放盐,但每次你可能会有不同的需求。传统的方法可能会把你的偏好写在纸上,或者每次都问你喜欢什么。而这篇研究像是给厨师配备了一个智能助手,它可以在厨房里偷偷观察你的反应,记住你喜欢的味道(长期偏好),同时也能根据当天的心情(会话内偏好)快速调整。每次你说“再辣一点”,它就会记住这个偏好,下次做菜时提前加辣。通过不断观察你的反应(弱奖励),它学会了更好地满足你的需求,不用你每次都重复告诉它。这就像有个聪明的厨师助手,既记住你喜欢的味道,也能灵活应对当天的心情变化,让做饭变得更轻松愉快。

简单解释 像给14岁少年讲一样

想象你在和朋友玩游戏。有时候,你会告诉朋友你喜欢用某个角色或者喜欢某种玩法。每次你们玩的时候,朋友都记得你的偏好,但如果你突然想试试新东西,朋友也能马上知道。这个研究就像是给游戏助手装了个聪明的脑袋,它可以偷偷学习你喜欢什么,记住你平时喜欢的角色(长期偏好),也能根据你当时的心情(会话内偏好)快速调整策略。它通过观察你每次的反应,比如说“还不错”或者“太难了”,慢慢学会了你的喜好。这样,你们的游戏就变得更有趣,也不用每次都告诉它该怎么玩了。这个聪明的助手用一种特别的方法,不断学习和调整,让你们的游戏体验变得更棒!

原文摘要

Large language models are increasingly used as personal assistants, yet most lack a persistent user model, forcing users to repeatedly restate preferences across sessions. We propose Vector-Adapted Retrieval Scoring (VARS), a pipeline-agnostic, frozen-backbone framework that represents each user with long-term and short-term vectors in a shared preference space and uses these vectors to bias retrieval scoring over structured preference memory. The vectors are updated online from weak scalar rewards from users' feedback, enabling personalization without per-user fine-tuning. We evaluate on \textsc{MultiSessionCollab}, an online multi-session collaboration benchmark with rich user preference profiles, across math and code tasks. Under frozen backbones, the main benefit of user-aware retrieval is improved interaction efficiency rather than large gains in raw task accuracy: our full VARS agent achieves the strongest overall performance, matches a strong Reflection baseline in task success, and reduces timeout rate and user effort. The learned long-term vectors also align with cross-user preference overlap, while short-term vectors capture session-specific adaptation, supporting the interpretability of the dual-vector design. Code, model, and data are available at https://github.com/YurenHao0426/VARS.

cs.CL cs.AI cs.HC cs.IR stat.ML