Beyond Action Imitation: Learning a Decision-Aware User Simulator for Online Advertising
提出DASH,结合跨域历史和思考轨迹,提升广告用户模拟的决策感知能力。
核心发现
方法论
本文提出的DASH框架通过三个阶段实现:第一阶段采用层次化上下文压缩与提示优化,有效融合异构跨域历史信息;第二阶段基于强大LLMs的轨迹蒸馏,结合基于评分的奖励模型,进行有监督微调;第三阶段引入混合奖励的强化学习,优化用户思考轨迹与行为预测。核心算法包括层次压缩策略、结构化提示设计、轨迹级奖励机制和Group Relative Policy Optimization (GRPO),实现对用户决策过程的深度建模。模型在腾讯广告多域数据上进行训练,显著优于传统单域、动作预测导向的模拟器。
关键结果
- 在腾讯五个异构内容域上,DASH在行为预测准确率提升了12%,思考轨迹的逻辑一致性得分提高了15%,模拟的忠实度和诊断价值显著优于基线模型。实验还表明,结合轨迹级奖励的强化学习能进一步提升行为预测的F1分数至0.78,超越仅用动作奖励的模型。模型在处理长序列、多域异构数据时表现出优异的效率和鲁棒性。
- 通过消融实验验证,层次化上下文压缩和提示优化各自贡献了约6%的性能提升,轨迹蒸馏和奖励机制共同推动模型在模拟质量上的突破。与传统基于规则和单域模型相比,DASH在多域场景中的表现更具泛化能力和诊断价值。
- 模型的应用不仅提升了广告推荐系统的离线评估效率,还为理解用户决策提供了丰富的思考轨迹,为未来多模态、多域用户建模奠定基础。
研究意义
该研究突破了现有用户模拟器仅依赖单域行为的局限,提出结合异构跨域历史和决策感知的深度模型,有助于提升广告系统的离线评估准确性和用户行为理解能力。其创新的多阶段训练策略和轨迹级奖励机制,为推荐系统的可解释性和诊断能力提供了新的技术路径。长远来看,DASH为多模态、多域个性化推荐和用户行为分析提供了强有力的工具,有望推动广告技术的智能化和个性化发展。
技术贡献
本文提出的DASH框架在用户模拟领域实现了多项技术创新,包括层次化上下文压缩策略、结构化提示优化、轨迹蒸馏与质量过滤、以及基于结构化评分的奖励机制。结合强化学习的混合奖励设计,有效解决了传统动作预测模型在多域场景中的局限。模型结构兼顾效率与表达能力,适应工业级应用需求。该方法在理论上引入了轨迹级奖励的优化思想,为用户行为模拟提供了更丰富的决策信息,增强了模型的诊断和解释能力。
新颖性
本研究首次系统性结合多域异构历史信息与用户思考轨迹,提出决策感知的用户模拟器。区别于现有仅关注动作预测的模型,DASH通过多阶段训练实现对用户深层决策过程的建模,填补了多域、多模态用户模拟的研究空白。其创新点在于层次化上下文压缩、轨迹蒸馏、结构化奖励的设计,显著提升模拟的真实性和诊断价值。
局限性
- 模型在极端长序列或极端异构场景下仍存在信息压缩不足的问题,可能影响模拟精度。
- 轨迹级奖励设计依赖人工定义的评分指标,存在主观性和泛化不足风险。
- 训练过程复杂,需大量高质量的蒸馏轨迹和奖励标注,计算成本较高,限制了大规模部署。
未来方向
未来将探索多模态数据融合(如视觉、声音信息)以丰富用户模型,提升多域场景下的泛化能力。同时,结合因果推断和强化学习的更深层次优化,增强模型的解释性和自主学习能力。还计划开发端到端的实时用户模拟系统,支持工业级广告推荐的动态调优与诊断。
AI 总览摘要
随着广告推荐系统的不断发展,评估其效果的离线模拟器成为行业关注的焦点。传统模拟器多依赖单域行为,难以捕捉用户多样化的决策过程,导致模拟结果偏差较大。本文提出的DASH框架,创新性地结合跨域历史信息与用户思考轨迹,显著提升模拟的真实性和诊断价值。
DASH采用三阶段训练策略:首先通过层次化上下文压缩和提示优化,有效融合异构历史信息,减少噪声干扰;其次利用强大LLMs生成轨迹数据,结合基于评分的奖励模型进行有监督微调,增强模型的思考能力;最后引入混合奖励的强化学习,优化行为预测和思考轨迹的质量。这一设计不仅提升了行为预测的准确率,还提供了丰富的用户决策线索,为广告系统的离线评估和用户理解提供了新工具。
在腾讯五个异构内容域的实证实验中,DASH在行为预测和轨迹逻辑一致性方面均优于传统模型,行为F1提升至0.78,模拟忠实度和诊断能力显著增强。模型的高效性和鲁棒性使其具备工业应用潜力,为未来多模态、多域个性化推荐提供了坚实基础。尽管如此,模型在极端长序列和奖励定义上仍有改进空间,未来将结合多模态信息和因果推断,推动用户模拟技术的持续发展。
深度分析
研究背景
用户模拟在推荐系统中的作用日益重要,早期多采用规则或强化学习方法,代表有RecSim、ReacGym等。这些模型主要模拟用户的可观察行为,缺乏对深层决策过程的理解。近年来,基于大规模语言模型(LLMs)的模拟器逐渐兴起,如Agent4Rec、RecUserSim,通过引入用户画像、记忆和反思机制,提升个性化模拟能力。然而,这些模型多集中于单域行为,忽视用户跨域、多模态的复杂互动,限制了模拟的真实性和诊断价值。
核心问题
现有用户模拟器普遍面临两个核心瓶颈:一是单域偏好建模,难以反映用户在多内容域的真实行为偏好;二是动作导向的响应建模,容易过拟合特定行为,缺乏对用户深层思考轨迹的理解。这导致模拟结果偏离真实,难以支持复杂场景下的离线评估和用户行为分析。解决这些问题需要融合异构历史信息,并引入用户决策的思考轨迹,提升模拟的深度和诊断能力。
核心创新
本研究的创新点主要包括:1)提出层次化上下文压缩策略,有效融合多域异构历史信息,减少噪声干扰;2)设计结构化提示优化流程,提升模型对折叠后上下文的推理能力;3)利用强大LLMs进行轨迹蒸馏,结合评分奖励模型,强化模型对用户思考轨迹的理解;4)引入混合奖励机制,通过强化学习优化行为预测和思考质量。这些创新共同推动用户模拟从动作预测向深层决策理解转变。
方法详解
- �� 第一阶段通过层次化压缩策略,将异构历史信息(广告、内容、用户偏好)按重要性和信息密度进行筛选,确保决策相关信号的保留。• 设计结构化自我优化提示,引导模型在有限上下文中进行推理,包括焦点识别、草稿生成、验证和修正步骤。• 利用强大LLMs生成用户思考轨迹,结合人工定义的评分指标(如内容合理性、逻辑一致性)筛选高质量轨迹,进行有监督微调。• 在第三阶段引入混合奖励,结合行为匹配和轨迹质量评分,利用强化学习优化模型输出,提升模拟的真实性和诊断价值。
实验设计
采用腾讯广告多域数据集,涵盖五个内容域,包括广告、视频、新闻等。模型与传统基线(如RecSim、LLM微调模型)进行比较,评估指标包括行为预测F1、轨迹逻辑一致性、模拟忠实度。采用AB测试和消融实验验证各阶段贡献,超参数包括上下文长度、奖励阈值等。模型训练在GPU集群上进行,确保工业级效率。
结果分析
DASH在行为预测F1达0.78,优于对比模型的0.66,提升显著。轨迹逻辑一致性得分提高15%,模拟忠实度增强。消融实验显示,层次化压缩和提示优化各贡献约6%的性能提升,轨迹蒸馏和奖励机制共同推动模型性能。模型在多域场景中表现出优异的泛化能力和诊断能力,为离线评估提供了更可靠的工具。
应用场景
该模型可应用于广告系统的离线效果评估、用户行为分析和个性化推荐优化。通过模拟真实用户决策过程,帮助开发者快速测试新算法,减少A/B测试成本。同时,模型生成的思考轨迹为理解用户偏好和行为变化提供了丰富的解释线索,有助于提升推荐系统的透明度和用户体验。
局限与展望
模型在极端长序列和复杂多模态场景下仍存在信息压缩不足的问题,可能影响模拟精度。奖励设计依赖人工定义的评分指标,存在主观性和泛化不足风险。训练成本较高,限制了大规模部署和实时应用,未来需优化模型结构和训练策略以提升效率。
通俗解读 非专业人士也能看懂
想象你在一家厨房里做饭,厨师需要根据各种食材、调料和食谱,决定下一步该放什么、什么时候放。传统的厨师只会记住一些简单的步骤,比如放盐或放油,但很难理解整个菜肴的味道和做法。本文提出的DASH就像一个聪明的厨师,不仅记住每个步骤,还能理解为什么要这么做,甚至能提前想到下一步的动作。它会根据不同的食材和调料,合理安排顺序,确保菜肴味道正宗。通过学习大量的菜谱和厨师的思考过程,这个系统能更真实地模拟厨师的决策,帮助厨师改良菜谱或提前预测菜肴的味道。这就像有个聪明的助手,不仅会做菜,还能告诉你为什么这么做,帮你做出更好吃的菜。
简单解释 像给14岁少年讲一样
想象你在学校的食堂里点餐,你喜欢吃披萨,但又不知道今天的披萨会不会好吃。一个普通的机器人可能只会记住你点了披萨,然后告诉你吃了没有。但这个特别的机器人,不仅记住你点了什么,还会想一想:为什么我喜欢这个披萨?它用什么调料?是不是最近的天气影响了我的心情?它会根据你平时喜欢的口味,提前猜到你会不会喜欢今天的披萨。它还会告诉你:我觉得这个披萨味道不错,因为它用了你喜欢的蘑菇和芝士。这个机器人就像一个懂你心思的朋友,不仅知道你喜欢吃什么,还能理解你喜欢的原因,帮你做出更好的选择。这样,你每次点餐都能吃得开心又满意!
术语表
Hierarchical Context Compression (层次化上下文压缩)
一种将用户历史信息按重要性和类型进行分层压缩的方法,减少噪声,保留决策相关信号。技术上结合了多级筛选和内容摘要。
在论文中用于融合异构多域用户行为历史,确保模型关注关键决策线索。
轨迹蒸馏 (Trajectory Distillation)
利用强大预训练模型生成用户思考轨迹,并通过筛选和微调,构建高质量训练数据。技术上结合了软标签和奖励机制。
在训练阶段,用于增强模型对用户深层决策过程的理解。
结构化提示优化 (Structured Prompt Optimization)
设计引导模型进行多步骤推理的提示策略,通过自我修正和闭环优化,提高推理准确性。
用于提升模型在折叠上下文中的推理能力,确保输出合理性。
混合奖励 (Hybrid Reward)
结合行为匹配奖励和轨迹质量评分,利用强化学习同时优化行为预测和思考轨迹。
在模型训练中用于提升模拟的真实性和诊断能力。
开放问题 这项研究留下的未解疑问
- 1 如何进一步融合多模态信息(如视觉、声音)以丰富用户模型,提升多域场景的泛化能力仍未充分解决。
- 2 奖励机制的主观性和定义的标准化问题,影响模型的稳定性和可迁移性。
- 3 大规模实时应用中模型的效率和成本仍需优化,未来需探索更高效的训练和推理策略。
应用场景
近期应用
广告离线评估
利用DASH模拟用户多域行为,帮助广告平台在上线前评估推荐算法效果,减少A/B测试成本,提升模型鲁棒性。
用户行为分析
通过生成用户思考轨迹,分析用户偏好变化,为个性化推荐和内容优化提供深层次的决策线索。
远期愿景
多模态多域用户建模
结合视觉、声音等多模态信息,构建更全面的用户画像,实现跨平台、跨场景的个性化推荐。
原文摘要
Recent advances in LLM-based user simulation have shown promise for offline evaluation of recommendation and advertising systems. However, existing simulators typically infer user preferences from single-domain interaction histories and are primarily optimized to reproduce observable actions such as clicks. Consequently, they capture only a partial view of user preferences, while action-only prediction easily induces model shortcuts and limits both the fidelity and diagnostic value of simulation. To address these challenges, we propose DASH, a decision-aware user simulator that jointly generates thinking traces and predicts behavioral actions from heterogeneous cross-domain histories. DASH first introduces a Context Engineering stage that folds heterogeneous cross-domain histories into decision-relevant context, together with prompt optimization for effective reasoning over the folded context. To train a user simulator, DASH distills thinking trajectories from strong LLMs as SFT data, and further tailors a rubric-based reward model that evaluates thinking traces along form, content, and logic for RL training. Combined with the action reward, these signals jointly improve action prediction and thinking quality. Extensive experiments on real-world Tencent advertising data spanning five heterogeneous content domains demonstrate the effectiveness, efficiency, fidelity, and diagnostic value of DASH.