Customer-R1: Personalized Simulation of Human Behaviors via RL-based LLM Agent in Online Shopping

TL;DR

提出Customer-R1,基于RL的个性化用户行为模拟方法,显著优于基线,提升预测准确率。

cs.CL 🔴 高级 2025-10-09 31 次浏览
Ziyi Wang Yuxuan Lu Yimeng Zhang Jing Huang Dakuo Wang
人类行为模拟 强化学习 大规模语言模型 个性化推荐 在线购物

核心发现

方法论

该方法结合显式用户画像信息,通过强化学习(GRPO算法)优化下一步行为生成。模型输入用户历史行为、网页状态和用户画像,输出行为 rationale 和预测动作。奖励机制包括动作正确性和格式一致性,鼓励语义合理的行为模拟。采用Qwen2.5-7B模型,结合监督微调(SFT)和RL优化,提升行为预测精度。实验在OPeRA数据集上验证,模型在下一动作预测准确率由零样本7.32%提升至39.58%,显著优于prompt和SFT基线。

关键结果

  • Customer-R1在下一动作预测任务中,准确率达39.58%,比SFT提升4.44个百分点,在行为分布匹配度上也优于基线模型,表现出更高的个性化模拟能力。
  • 引入用户画像显著改善模型的行为多样性和个性化匹配,去除画像或 rationale 会导致性能下降,验证了个性化信息的重要性。
  • 模型在不同规模和上下文长度下表现一致,长上下文(65k tokens)提升行为预测的稳定性和准确性,模型规模越大,性能越优。

研究意义

该研究突破了以往仅能模拟平均用户行为的局限,提出了结合用户画像的个性化行为模拟框架,为电子商务、个性化推荐和用户行为理解提供了新工具。其强化学习机制增强了模型的行为一致性和多样性,推动了人机交互和行为模拟的研究前沿。长远来看,有望实现更真实、更细粒度的用户行为仿真,改善个性化服务体验,促进智能推荐系统的智能化升级。

技术贡献

技术创新在于引入显式用户画像条件的强化学习策略,结合action correctness奖励和格式约束,显著提升行为预测的准确性和个性化水平。采用GRPO算法优化策略,结合监督微调,兼顾模型稳定性和性能。提出的reward设计和prompt工程,为行为模拟提供了可验证的奖励信号,增强模型的行为一致性和泛化能力。这在现有SOTA方法基础上,突破了个性化行为模拟的瓶颈。

新颖性

本研究首次系统性将用户画像融入RL驱动的行为模拟框架,利用verifiable reward机制实现个性化、step-wise的用户行为仿真。与传统基于prompt或纯SFT的方法不同,强调行为的语义合理性和个性化匹配,填补了个性化行为模拟的研究空白。创新点在于结合显式画像信息与强化学习,提升行为生成的真实性和多样性。

局限性

  • 模型依赖高质量的用户画像信息,若画像不准确或缺失,性能会明显下降,限制了实际应用的鲁棒性。
  • 强化学习训练成本较高,尤其在大模型和长上下文中,训练时间和资源消耗巨大,影响推广。
  • 行为模拟仍受限于数据集的多样性,难以覆盖所有用户行为场景,未来需扩展多样化数据源。

未来方向

未来将探索多模态用户画像的融合,提升模型对复杂行为的理解能力。同时,研究如何降低训练成本,增强模型的泛化能力,适应不同应用场景。此外,结合强化学习中的多目标优化,提升行为的多样性和真实性,推动个性化行为模拟向更高层次发展。

AI 总览摘要

随着大规模语言模型(LLMs)在模拟人类行为方面的潜力不断被发掘,个性化用户行为模拟成为研究热点。传统方法多依赖prompt或监督微调(SFT),但缺乏对个体差异的建模,导致生成的行为较为通用,难以满足个性化需求。本文提出Customer-R1,一种基于强化学习(GRPO算法)的方法,结合显式用户画像信息,实现在线购物场景中的step-wise个性化行为模拟。模型输入用户历史行为、网页状态和画像,输出行为 rationale 和预测动作,通过奖励机制优化行为的正确性和语义合理性。实验在OPeRA数据集上验证,结果显示该方法在下一动作预测准确率由7.32%提升至39.58%,显著优于prompt和SFT基线,且行为分布更贴合用户画像,表现出更高的个性化水平。这一突破为电子商务、推荐系统等领域提供了更真实、更个性化的用户模拟工具。未来,结合多模态信息和多目标优化,有望实现更复杂、更真实的用户行为仿真,推动个性化服务的智能化升级。

深度分析

研究背景

人类行为模拟在心理学、社会科学和人机交互中扮演重要角色。早期研究多关注行为的宏观描述,近年来随着LLMs的发展,逐渐转向step-wise行为预测。代表性工作包括Lu et al.(2025a)利用SFT在私有数据上训练,Zhang et al.(2025b)提出Shop-R1强化学习方法,提升行为生成准确性。尽管如此,现有方法多关注平均用户行为,缺乏个性化建模,限制了实际应用的效果。近年来,用户画像逐渐被引入行为模拟中,但多停留在离线分析或未结合强化学习优化,缺少系统性框架。本文在此基础上,结合强化学习和显式画像信息,提出了更具个性化和可验证的行为模拟方案。

核心问题

核心问题在于如何在step-wise行为模拟中融入个体差异,实现高保真度的个性化仿真。现有方法多忽视用户画像的作用,导致生成行为缺乏个性化特征,难以反映不同用户的偏好和目标。另一方面,强化学习虽能优化行为策略,但缺乏有效的奖励机制指导行为合理性,导致行为偏离真实用户。解决这一问题对于提升推荐系统的用户体验、理解用户行为模式具有重要意义,但面临数据稀缺、奖励设计困难和模型泛化等挑战。

核心创新

创新点包括:1)引入显式用户画像作为条件信息,增强模型对个体差异的感知;2)设计verifiable reward机制,结合动作正确性和格式一致性,确保行为合理性;3)采用GRPO强化学习算法,优化step-wise行为生成策略,兼顾稳定性和性能;4)结合prompt工程,增强模型对画像信息的利用能力。这些创新突破了以往只依赖prompt或SFT的局限,使行为模拟更具个性化和真实性。

方法详解

  • �� 输入:用户历史行为、网页状态、用户画像。
  • �� 模型结构:基于Qwen2.5-7B,结合prompt引导,输出行为 rationale 和动作预测。
  • �� 训练策略:先用SFT微调,确保基础行为理解,再用GRPO强化学习优化行为策略。
  • �� 奖励设计:动作正确性奖励(完全匹配得1分),格式奖励(符合JSON schema得1分),加权提升复杂行为的奖励。
  • �� 训练过程:多轮采样、奖励回传、策略更新,确保模型学习到个性化行为规律。

实验设计

采用OPeRA数据集,包含527个真实购物会话,行为总数5856,涵盖多样行为类型。模型在不同设置(零样本、SFT、RL、SFT+RL)下进行训练和评估。指标包括下一动作准确率、行为类型F1、细粒度预测准确率和会话终止预测。通过对比不同模型规模和上下文长度,验证模型的鲁棒性和效果。采用synthetic rationale增强,提升模型理解能力。实验结果显示,SFT+RL模型在所有指标上表现最佳,准确率达39.58%,比基线提升显著。

结果分析

模型在下一动作预测中的准确率由零样本的7.32%提升至39.58%,在行为类型和细粒度预测上也表现优异。引入用户画像和 rationale 后,模型行为更贴合用户偏好,表现出更强的个性化能力。长上下文(65k tokens)进一步提升模型稳定性和预测准确性。 Ablation研究验证了画像和 rationale 对性能的关键作用,去除任何一项都会显著降低效果。整体来看,模型在行为模拟的真实性和多样性方面取得了突破。

应用场景

该方法可应用于个性化推荐、用户行为分析、虚拟用户生成等场景。通过模拟真实用户行为,提升推荐系统的准确性和用户体验。未来还可结合多模态信息(如图片、语音)实现更复杂的用户行为仿真,为智能客服、虚拟助手等提供支持。长远目标是实现全场景、多维度的用户行为建模,推动个性化服务的智能化升级。

局限与展望

模型高度依赖用户画像的准确性,若画像信息不完整或偏差,模拟效果会受影响。强化学习训练成本高,尤其在大模型和长上下文中,资源消耗大。此外,数据集有限,难以覆盖所有实际场景,未来需扩展多样化数据源,提升模型的泛化能力。模型在极端行为或新颖场景下表现仍有待优化。

通俗解读 非专业人士也能看懂

想象你在一家餐厅点餐,服务员会根据你的喜好和之前的点餐习惯推荐菜品。这个系统就像一个非常聪明的服务员,能记住你喜欢吃什么、偏好什么口味,还能根据你之前的选择预测你下一次可能会点什么。它不仅知道你喜欢辣的还是不辣的,还能根据你的偏好推荐不同的菜肴。为了做到这一点,它学习了很多人的点餐习惯,结合你的个人信息,模拟出你真实的用餐行为。这样一来,每次你点餐时,服务员都能给出符合你口味的建议,让你觉得像和朋友一样贴心。这种模拟不仅让餐厅的服务更智能,也让你体验到更个性化的服务。

简单解释 像给14岁少年讲一样

想象你在学校里,有个超级聪明的朋友,他能记住你平时喜欢什么、做过什么,然后帮你预测下一次你会做什么。比如,你喜欢玩足球,他就会猜到你下一次可能会去操场踢球。这个朋友还会根据你的喜好,给你推荐一些你可能喜欢的东西,比如喜欢的游戏或者书。它学习了很多人的习惯,然后用这些信息,模拟出你真实的行为。这样,你每次做决定时,它都能帮你想好下一步,像个贴心的助手一样。这个系统让我们的生活变得更方便、更有趣,因为它懂得我们每个人的特别之处,就像有个专属的朋友一样。

原文摘要

Simulating step-wise human behavior with Large Language Models (LLMs) has become an emerging research direction, enabling applications in various practical domains. While prior methods, including prompting, supervised fine-tuning (SFT), and reinforcement learning (RL), have shown promise in modeling step-wise behavior, they primarily learn a population-level policy without conditioning on a user's persona, yielding generic rather than personalized simulations. In this work, we pose a critical question: how can LLM agents better simulate personalized user behavior? We introduce Customer-R1, an RL-based method for personalized, step-wise user behavior simulation in online shopping environments. Our policy is conditioned on an explicit persona, and we optimize next-step rationale and action generation via action correctness reward signals. Experiments on the OPeRA dataset emonstrate that Customer-R1 not only significantly outperforms prompting and SFT-based baselines in next-action prediction tasks, but also better matches users' action distribution, indicating higher fidelity in personalized behavior simulation.

cs.CL