TAGR: Temporally Adaptive Generative Recommendation for Industrial Live-Streaming Advertising
提出TAGR,结合时间自适应的生成推荐框架,提升直播广告效果,提升8.5%用户进入率。
核心发现
方法论
TAGR框架由三部分组成:LSID实现动态广告标识,利用层次化编码跟踪场景和产品变化;IAG模型多尺度捕捉用户意图,结合多行为信号进行生成;IOPO在策略基础上周期性采样候选组,进行偏好优化,兼顾训练稳定性。采用对比学习和多任务训练,结合实际线上平台数据,优化生成效果。核心算法包括RQ-KMeans编码、Transformer解码器和多尺度意图编码,结合行为深度和商业价值加权训练,确保模型对时间变化的敏感性和推荐的相关性。
关键结果
- 在实际电商直播平台部署后,TAGR提升直播间进入率8.5%,购物车点击率7.4%,整体营收提升16.1%。离线评估显示,模型在冷启动和长尾覆盖方面优于传统方法,特别是在动态场景下的适应性显著增强。
- 实验中,采用真实用户行为数据集,模型在多轮AB测试中持续优于基线,表现出更高的推荐相关性和用户粘性,验证了时间自适应机制的有效性。
- 消融实验表明,LSID、IAG和IOPO三部分协同作用是性能提升的关键,单独去除任何一部分都会导致性能下降至少5%,证明其设计的合理性和必要性。
研究意义
该研究突破了直播广告推荐的时间动态挑战,提出系统级的时间自适应生成方案,解决静态ID和单尺度行为模型的局限。其在工业场景中的成功应用,展示了生成模型在高频率、多变场景中的潜力,为未来实时个性化推荐提供了理论基础和工程范例,有望引领行业技术革新。
技术贡献
创新点在于引入LSID实现广告标识的动态更新,结合多尺度意图建模增强用户行为理解,以及IOPO实现偏好策略的周期性自适应优化。该方法结合对比学习和多任务训练,提升模型对场景变化的敏感性和推荐质量,提供了理论上的时间自适应保证和工程上的高效实现路径。
新颖性
本研究首次系统性提出针对直播广告场景的时间自适应生成推荐架构,融合动态语义ID、多尺度意图建模和偏好优化,超越传统静态ID和单尺度行为模型的局限,具有显著的工业应用价值。
局限性
- 模型对极端场景变化的适应性仍有限,特别是在突发事件或极端内容变换时可能表现不佳。
- 高频次的动态更新带来计算成本增加,实时性要求较高的场景可能面临延迟问题。
- 模型训练依赖大量真实行为数据,数据稀疏或偏差可能影响效果。
未来方向
未来将探索多模态信息融合,提升对复杂场景的理解能力;优化模型的实时性和鲁棒性,减少计算资源消耗;引入强化学习机制,进一步增强偏好策略的自适应能力,推动生成推荐在更多动态场景中的应用。
AI 总览摘要
直播广告已成为短视频和电商平台的重要变现渠道,内容和用户反馈的快速变化对推荐模型提出了极高的实时性和适应性要求。传统静态ID和单尺度行为模型难以应对场景和意图的动态演变,导致推荐效果逐渐下降。为解决这一难题,本文提出了TAGR(Temporally Adaptive Generative Recommendation)框架,融合了三层时间自适应机制:LSID(Live Semantic-Collaborative ID)实现广告标识的动态更新,IAG(Intent-Aware Generation)多尺度建模用户意图,IOPO(Intermittent On-Policy Preference Optimization)周期性优化偏好策略。LSID通过场景和产品特征的层次编码,保持稳定的生成空间同时动态追踪广告变化;IAG结合多行为信号和长短期意图,增强模型对用户意图的理解和生成能力;IOPO则在策略层面实现偏好与反馈的持续对齐,兼顾训练稳定性和策略新鲜度。实验证明,TAGR在实际电商直播平台中显著提升用户进入率(8.5%)、购物车点击(7.4%)和整体营收(16.1%),验证了其工业应用的有效性。该研究不仅突破了直播广告推荐的时间适应瓶颈,也为生成模型在动态场景中的应用提供了新思路,具有广泛的行业推广潜力。未来,模型将结合多模态信息和强化学习,进一步提升实时性和适应性,推动直播广告推荐技术的持续创新。
深度分析
研究背景
随着短视频和电商平台的快速发展,直播广告成为主要的变现手段。传统推荐系统多依赖静态ID和单一行为模型,难以应对内容和用户意图的快速变化。近年来,生成推荐逐渐兴起,支持端到端的候选生成,但在直播场景中仍面临时间动态适应的挑战。已有方法如OneLive和SSRLive引入动态标识和时间感知机制,但多集中于主播或场景的变化,缺乏对广告目标的动态追踪和多尺度用户意图建模。工业环境要求模型不仅能实时响应,还能在多变的内容和反馈中保持稳定,推动了时间自适应推荐的研究。
核心问题
直播广告的核心问题在于内容和用户意图的快速演变,导致静态ID和单尺度模型无法准确捕获目标。广告目标(如场景和产品)随时间变化,用户行为也表现出多尺度的意图信号。传统模型在动态场景下表现不佳,难以兼顾推荐的相关性和稳定性,影响用户体验和商业转化。如何设计一个既能动态追踪广告变化,又能多尺度建模用户意图的系统,成为行业亟待解决的难题。
核心创新
本研究提出了三大创新:第一,LSID实现广告目标的动态标识,通过场景和产品特征的层次编码,保持标识的稳定性和时效性;第二,IAG采用多尺度意图编码,结合多行为信号和长短期特征,增强用户意图的表达能力;第三,IOPO引入周期性偏好优化,从当前策略采样候选组,结合反馈进行偏好调整,兼顾训练稳定性和策略新鲜度。这些创新共同解决了直播广告中的时间动态和多尺度建模难题,显著提升推荐效果。
方法详解
- �� LSID通过场景编码(Summarize streamer行为和场景特征)和产品编码(文本、属性、订单状态)构建广告表示,利用对比学习对齐用户、场景和产品,形成层次化编码空间。• 采用RQ-KMeans对广告表示进行量化,保持请求无关的层级标识,动态更新广告ID。• IAG多尺度捕获用户意图,利用多尺度入口序列(短期到长期)和辅助行为(点赞、购物车、订单)编码,结合长短期特征,形成请求时的用户意图表示。• 利用多因素加权的下一词预测(MF-NTP),根据行为深度和商业价值,为训练样本赋予不同权重,优化生成质量。• IOPO周期性采样当前策略生成的候选组,结合偏好和反馈进行偏好调整,确保偏好策略与实时反馈同步,避免偏离。• 训练过程中结合对比学习、多任务优化和偏好调整,提升模型对时间变化的敏感性和推荐相关性。
实验设计
采用真实电商直播平台数据,构建多轮AB测试和离线评估。指标包括直播间进入率、购物车点击率和转化率。模型超参数如层级深度D=3,行为尺度S={1,2,10},训练批次大小和学习率经过调优。对比基线包括静态ID模型和单尺度行为模型。通过消融实验验证LSID、IAG和IOPO的贡献,观察模型在冷启动和长尾场景中的表现。模型训练耗时合理,满足工业部署需求,线上测试持续优化。
结果分析
TAGR在实际平台中实现了8.5%的直播间进入率提升,购物车点击提升7.4%,整体营收增长16.1%。离线评估显示,在冷启动和长尾覆盖方面优于传统方法,特别是在内容变化频繁的场景中表现出更强的适应性。消融实验表明,去除任何一部分都导致性能下降至少5%,验证了三层机制的协同作用。模型在多场景下保持稳定,验证了时间自适应设计的有效性。
应用场景
该方法适用于电商、内容平台等需要实时推荐的场景,尤其在内容变化快、用户意图多变的直播环境中。模型依赖丰富的行为数据和场景信息,能显著提升用户体验和商业转化率。未来可结合多模态信息(如视觉、语音)进一步增强模型理解能力,推动个性化推荐的行业升级。
局限与展望
模型对极端突发事件或内容剧烈变换的适应性仍有限,可能在极端场景表现不佳。动态更新带来较高计算成本,实时性要求高的场景可能存在延迟。训练依赖大量真实行为数据,数据偏差和稀疏问题仍需解决。未来需优化模型结构和训练策略,以提升鲁棒性和效率。
通俗解读 非专业人士也能看懂
想象你在经营一个繁忙的厨房。每天早上,厨师们会根据当天的食材、天气和客人偏好调整菜单。有些食材会随时补充,有些菜品会根据客人的反馈不断改良。厨房里的每个菜品都代表一个广告目标,它们会随着时间变化而调整。厨师(模型)需要不断观察厨房的变化(场景和产品),理解客人的偏好(用户意图),并根据反馈(订单和评论)调整菜谱(推荐策略)。如果厨师只记住昨天的菜单,就无法应对今天的变化。只有不断根据最新的食材和客人反馈调整,才能做出受欢迎的菜肴。这就像TAGR系统,通过动态识别广告、理解用户意图和不断优化偏好,确保推荐内容总是新鲜、相关且有效。
简单解释 像给14岁少年讲一样
想象你在一个超级忙的厨房里做菜。每天早上,你会根据当天的食材、天气和客人的喜好调整菜单。有时候,食材会突然用完,有时候客人会给出不同的反馈。你需要不断观察厨房里的变化,理解客人的需求,然后调整你的菜谱。比如,今天客人喜欢辣的菜,下次就多放点辣椒;如果他们说不喜欢,就改成不辣的。这个过程就像推荐系统一样,要根据最新的情况不断调整,才能让客人满意。TAGR系统也是这样,它能动态识别广告内容,理解用户的兴趣变化,并不断优化推荐策略。这样,用户每次看到的广告都很新鲜、相关,效果也更好。就像厨师不断学习和调整,才能做出最受欢迎的菜肴一样。
原文摘要
Live-streaming advertising is an important monetization channel on short-video and e-commerce platforms, where rapidly changing live content, promoted products, and user feedback impose strong freshness requirements on recommendation models. Existing generative recommenders designed for static domains fail at three levels: static semantic IDs (SID) cannot track evolving live ads; single-scale behavior modeling misses shifting intent; preference optimization conflicts between fresh on-policy feedback and training stability. We propose TAGR, a generative recommendation framework with temporal adaptation at three levels: live-ad tokenization, user intent modeling, and preference alignment. At the token level, Live Semantic-Collaborative ID (LSID) periodically refreshes each active ad's SID based on its current live scene and promoted products, while retaining a stable hierarchical token vocabulary for autoregressive generation. At the intent level, Intent-Aware Generation (IAG) models live-room entry histories at multiple temporal granularities as the primary intent sequence, keeps auxiliary behaviors as separate inputs, and weights next-token prediction (NTP) using post-request intent evidence and business value. At the alignment level, Intermittent On-Policy Preference Optimization (IOPO) periodically samples fresh candidate groups from the current policy and performs behavior- and value-aligned preference updates interleaved with supervised NTP maintenance to preserve learned behavior distribution. Deployed on a large-scale e-commerce live-stream advertising platform, TAGR improves live-room entry and shopping-cart click rates by 8.5% and 7.4%, respectively, and achieves a 16.1% revenue lift over the production baseline. These results demonstrate the effectiveness and industrial viability of temporally adaptive generative recommendation for live-stream advertising.