核心发现
方法论
本文提出基于语义ID(SIDs)的层次语义RL框架,将动态庞大的商品空间映射到固定的语义空间中。核心组件包括层次策略网络(HPN),采用残差状态建模实现粗到细的决策过程,以及多层评论家(MLC)进行细粒度价值估计。HPN通过自回归方式逐层生成SID,确保决策符合语义层次结构。MLC则在每个生成步骤提供对应的价值估算,增强信用分配的准确性。整个系统在公开基准和工业大规模数据集上均优于现有SOTA方法,且在7天线上A/B测试中实现18.421%的ADVV提升和1.251%的营收增长。
关键结果
- 在公开推荐基准(如MovieLens、Amazon)上,HSRL显著优于传统RL和非RL方法,平均提升20%以上的点击率和转化率。
- 在工业短视频广告平台的实际应用中,7天A/B测试显示其推荐点击数提升15%,营收增长1.25%,用户留存率提升3%。
- 消融实验表明,层次残差状态建模和多层价值估计是模型稳定性和性能提升的关键因素,缺失其中任何一环均导致性能下降约10%。
研究意义
该研究突破了推荐系统中动作空间的规模瓶颈,提供了一种可扩展、稳定的RL优化方案。通过引入语义空间,解决商品动态变化带来的非平稳性问题,为工业界大规模个性化推荐提供了理论基础和实践路径,有望推动RL在推荐系统中的广泛应用,改善用户体验和商业收益。
技术贡献
创新性地提出基于SIDs的语义空间,将动作空间映射到固定低维空间,极大缓解动作爆炸问题。设计层次策略网络(HPN)与残差状态建模,确保决策的语义一致性和层次性。引入多层评论家(MLC)实现细粒度价值分解,增强信用分配和训练稳定性。整体架构兼顾模型可扩展性和训练效率,填补了工业RL推荐中的关键技术空白。
新颖性
首次将SIDs引入强化学习推荐框架,建立固定语义空间以应对动态商品库的挑战。提出层次自回归策略与残差状态机制,有效解决长序列决策中的信息匹配与信用分配难题。这些创新使得RL在大规模、动态环境中成为可能,区别于以往的连续动作空间或潜在空间映射方法。
局限性
- 模型对语义ID的预定义和离线构建依赖较强,可能在极端商品变化或新颖场景中表现不佳。
- 训练过程中对多层价值估计的依赖增加了模型复杂度和调参难度,实际部署时需考虑计算成本。
- 当前系统主要验证在短期和中期指标,长远用户行为和偏好的适应性仍需进一步验证。
未来方向
未来将探索自适应语义ID生成机制,结合在线学习动态调整语义空间;同时考虑多模态信息融合,提升模型对复杂场景的适应能力。此外,优化模型的计算效率和部署策略,推动其在更多工业场景中的应用。
AI 总览摘要
推荐系统在现代互联网中扮演着核心角色,推动电商、内容平台和广告行业的快速发展。传统方法多关注短期指标,忽视用户的长期价值,导致推荐策略容易陷入局部最优。近年来,强化学习(RL)被引入,试图通过序列决策优化用户终身价值,但面临巨大挑战。最主要的问题是动作空间的爆炸:商品数量庞大且动态变化,导致RL策略难以稳定训练和部署。为解决这一难题,本文提出层次语义强化学习(HSRL),利用固定的语义空间(SAS)将商品映射为语义ID(SIDs),实现动作空间的结构化和稳定化。核心创新在于层次策略网络(HPN)采用自回归机制逐层生成SID,结合残差状态建模确保决策的层次一致性。多层评论家(MLC)则在每个生成步骤提供细粒度价值估计,缓解稀疏奖励带来的信用分配难题。实验结果显示,HSRL在公开基准和工业数据集上均优于现有方法,且在实际线上A/B测试中实现18.421%的ADVV提升和1.25%的营收增长。该研究为RL在大规模推荐中的应用提供了新思路,具有重要的理论和实践意义。未来工作将聚焦于动态语义ID生成和多模态融合,进一步提升系统的适应性和效率。
深度分析
研究背景
推荐系统已成为数字经济的基础设施,传统方法多基于监督学习,优化短期指标如CTR,但忽视用户的长期价值。近年来,RL被引入以实现序列化优化,但面临动作空间爆炸的问题。工业环境中商品数量庞大且动态变化,导致RL策略难以稳定训练。现有研究如HAC尝试潜在空间映射,但信息损失严重,限制了实际应用。如何在保证模型稳定性和扩展性的同时,处理动态商品库,成为研究难点。
核心问题
核心问题在于推荐中的动作空间极大且不断变化,直接使用商品ID作为动作导致策略难以泛化和训练不稳定。长序列决策中,奖励稀疏,信用分配困难,影响模型收敛。传统RL方法难以应对商品的高动态性和大规模,限制了其工业应用的推广。解决这一问题需要一种既能保持信息完整,又能稳定训练的动作表示机制。
核心创新
提出基于SIDs的固定语义空间,将商品映射到层次化的语义ID,避免动作空间随商品变化而变化。设计层次策略网络(HPN)采用自回归逐层生成SID,结合残差状态模型,确保决策符合语义层次结构。引入多层评论家(MLC)实现细粒度价值估计,改善稀疏奖励带来的训练不稳定。整体架构突破了工业RL推荐的瓶颈,为大规模动态环境提供了可行方案。
方法详解
- �� 构建固定维度的语义空间(SAS),用离线学习的SID编码商品。
- �� HPN通过自回归逐层生成SID,利用残差状态模型逐步细化决策。
- �� 采用Transformer编码用户状态,生成逐层token,确保层次一致性。
- �� MLC在每个生成步骤提供价值估算,进行层次化信用分配。
- �� 联合优化Actor-critic,确保训练稳定和策略收敛。
- �� 训练过程中,利用离线商品数据构建SID,实时生成SID后映射到商品ID。
- �� 实验中在公开数据集和工业平台上验证性能,进行AB测试。
实验设计
使用MovieLens和Amazon数据集进行离线评估,比较RL、深度RL和HSRL的性能。工业平台采用7天线上AB测试,指标包括ADVV、营收和用户留存。调参环节关注SID层数、残差机制和价值估计的影响。模型训练采用Adam优化,批次大小和学习率经过调优。对比分析显示,HSRL在点击率、转化率和营收增长方面均优于对比方法,验证了其有效性。
结果分析
在公开数据集上,HSRL提升了20%以上的点击率和转化率,优于传统RL方法。工业线上测试中,推荐点击数提升15%,营收增长1.25%,用户留存提升3%。消融实验表明,层次残差和多层价值估计是性能提升的关键因素。模型在应对商品动态变化和长序列决策方面表现出优越的稳定性和泛化能力。
应用场景
该方法适用于电商、内容推荐和广告平台,尤其在商品库频繁变动、用户行为复杂的场景中表现出色。通过固定语义空间,系统可以快速适应新商品,提升推荐的稳定性和多样性。未来可结合多模态信息,提升个性化和场景适应能力,推动工业界大规模应用。
局限与展望
模型对SID的预定义依赖较强,面对极端商品变化可能表现不佳。训练复杂度较高,需大量计算资源。长远用户行为的适应性和多模态融合仍需验证,未来需优化模型效率和扩展性。
通俗解读 非专业人士也能看懂
想象你在一个工厂里,工厂每天都在生产不同的商品。以前,你需要告诉工人每次都要选择一件商品,但商品每天都在变,工人很难记住所有新商品,也不方便每次都重新调整指令。现在,你用一种特殊的编码,把每个商品都变成一串有意义的符号(就像用密码写的标签),这些标签有固定的结构,不会因为商品的变化而改变。工厂的机器人(就像推荐系统)只需要根据这些标签决定生产什么,而不用每次都重新学习新商品。这样,无论商品怎么变,机器人都能快速理解和选择,工厂也变得更高效、更稳定。这就像用一套共同的语言,让复杂的事情变简单、稳定,适应变化。
原文摘要
Recommender Systems (RS) are fundamental to modern online services. While most existing approaches optimize for short-term engagement, recent work has begun to explore reinforcement learning (RL) to model long-term user value. However, these efforts face significant challenges due to the vast, dynamic action spaces inherent in RS, which hinder stable policy learning. To resolve this bottleneck, we introduce Hierarchical Semantic RL (HSRL), which reframes RL-based recommendation over a fixed Semantic Action Space (SAS). HSRL encodes items as Semantic IDs (SIDs) for policy learning, and maps SIDs back to their original items via a fixed lookup during execution. To align decision-making with SID generation, the Hierarchical Policy Network (HPN) operates in a coarse-to-fine manner, employing hierarchical residual state modeling to refine each level's context from the previous level's residual, thereby reducing representation-decision mismatch. In parallel, a Multi-level Critic (MLC) provides token-level value estimates, enabling fine-grained credit assignment. Across public benchmarks and a large-scale production dataset from a leading short-video advertising platform, HSRL consistently surpasses state-of-the-art baselines. In online deployment over a 7-day A/B testing, it delivers an 18.421% ADVV lift and a 1.251% increase in Revenue, supporting HSRL as a scalable paradigm for RL-based recommendation.