GRADE: Personalized Multi-Task Fusion via Group-relative Reinforcement Learning with Adaptive Dirichlet Exploration
提出GRADE框架,利用组相对策略优化和Dirichlet探索实现个性化多任务融合,显著提升CTR、CVR等指标。
核心发现
方法论
本文提出基于组相对策略优化(GRPO)和Dirichlet分布的强化学习框架GRADE,用于动态调节多任务融合权重。采用无Critic设计,利用候选权重组的相对优劣进行学习,避免Critic网络不稳定问题。Dirichlet分布用于探索连续权重空间,保证权重非负且和为一。结合稀疏用户反馈、模型先验和规则约束的复合奖励函数,有效引导搜索。训练分为监督预训练和强化微调两个阶段,确保模型稳定性与个性化能力。
关键结果
- 在某大型应用中的AB测试中,GRADE实现了CTR提升0.595%、CVR提升1.193%、OPM提升1.788%、订单总量提升1.568%,优于多种基线方法。
- 在Kuaishou的搜索场景中,全面部署后持续优化用户体验,显著优于传统静态加权方案,验证了其在实际工业环境中的有效性。
- 消融实验显示Dirichlet探索和复合奖励机制对模型性能提升具有关键作用,增强了探索效率和稳定性。
研究意义
该研究突破了传统静态融合策略的局限,提出基于组相对强化学习的个性化多任务融合新范式。解决大规模推荐系统中训练不稳定、探索低效的问题,为工业界提供了可行的解决方案。其在实际应用中的优异表现,推动了个性化推荐的技术进步,有望引领行业采用更智能、更稳定的动态调节机制,提升用户满意度和商业价值。
技术贡献
创新点在于引入无Critic的组相对策略优化(GRPO),结合Dirichlet分布进行连续空间探索,以及设计多元复合奖励函数,增强学习信号的丰富性与稳定性。该框架突破了传统Actor-Critic架构的复杂性和不稳定性,为大规模推荐系统提供了高效、稳健的优化工具。
新颖性
首次将组相对策略优化应用于推荐系统中的多任务融合,利用Dirichlet分布实现高维连续权重探索,结合多源奖励机制,显著改善训练稳定性和探索效率。这一创新突破了现有RL方法在大规模工业场景中的应用瓶颈,展现出强大的实用潜力。
局限性
- 模型依赖大量用户反馈数据,面对冷启动或反馈稀疏场景时效果可能受限。
- Dirichlet探索虽有效,但在极高维空间中可能面临计算成本增加的问题。
- 当前框架主要在特定推荐场景验证,泛化到其他多任务融合任务仍需进一步验证。
未来方向
未来将探索多模态、多源数据的融合能力,提升模型在冷启动和稀疏反馈环境中的表现。同时,优化Dirichlet采样效率,结合元学习实现更快适应不同场景的个性化需求,推动工业界更广泛应用。
AI 总览摘要
随着互联网推荐系统的不断发展,个性化、多目标优化成为提升用户体验的核心。传统方法多依赖静态加权,难以适应用户偏好变化,且调参繁琐。本文提出的GRADE框架,基于组相对强化学习(GRPO)和Dirichlet探索机制,创新性地实现了动态、个性化的多任务融合。该方法通过无Critic设计,避免了训练不稳定的问题,利用Dirichlet分布在连续空间中高效探索权重组合,结合多源奖励信号,确保搜索的丰富性和稳定性。经过在大规模工业场景中的部署,结果显示其在CTR、CVR、订单量等指标上均优于传统静态方案,验证了其强大实用价值。该研究不仅推动了推荐系统个性化的技术边界,也为未来多任务融合提供了新的思路。未来,结合多模态数据和元学习技术,有望实现更快速、更智能的个性化调节,满足不断变化的用户需求。尽管如此,模型在冷启动和高维探索中仍面临挑战,未来工作将聚焦于提升算法效率和泛化能力,推动行业广泛应用。
深度分析
研究背景
推荐系统的多目标优化一直是行业关注的焦点。早期多任务学习(MTL)通过共享参数提升模型泛化能力,但在实际应用中,融合多个目标的权重调节仍依赖静态策略,难以满足个性化需求。近年来,强化学习(RL)被引入动态调节权重,解决了静态方案的局限,但传统Actor-Critic架构在大规模场景中训练不稳定,探索效率低。Group Relative Policy Optimization(GRPO)在LLMs中的成功启示了其在推荐中的潜力,结合Dirichlet分布的探索机制,为实现高效、稳定的个性化多任务融合提供了新路径。
核心问题
现有多任务融合方法多采用预定义的静态加权,难以适应用户偏好变化,导致用户体验不佳。强化学习虽具潜力,但在大规模工业场景中,训练不稳定、探索低效成为主要瓶颈。如何设计一种既稳定又高效的个性化调节机制,成为行业亟待解决的问题。尤其是在高维连续空间中,探索策略的效率直接影响模型性能和部署效果。
核心创新
提出无Critic的组相对策略优化(GRPO),避免Critic网络带来的不稳定,提升训练稳定性。引入Dirichlet分布进行连续空间探索,保证权重非负且和为一,适应多任务融合的约束条件。设计多源复合奖励,结合用户反馈、模型先验和规则约束,丰富学习信号,提升搜索效率。训练流程包括监督预训练和强化微调两个阶段,确保模型稳定且具备个性化调节能力。
方法详解
- �� 输入:用户特征、行为历史、查询信息等。
- �� 阶段一:利用LambdaLoss框架进行多目标学习,预训练基础模型。
- �� 阶段二:在GRPO框架下,采样候选权重组,评估相对优劣。
- �� Dirichlet分布用于探索连续权重空间,保证非负且和为一。
- �� 计算相对优势(reward normalization),更新策略以增强优良候选。
- �� 复合奖励:结合用户反馈、模型预测和规则约束,提供多维信号。
- �� 训练流程:先监督初始化,再强化微调,确保模型稳定性和个性化能力。
实验设计
在某大型电商平台进行AB测试,使用真实用户行为数据,比较静态加权、多任务RL和GRADE。指标包括CTR、CVR、订单量等。采用多源奖励机制,调节Dirichlet参数,进行消融实验验证各组件效果。模型训练在GPU集群上进行,持续优化超参数,确保收敛稳定。结果显示,GRADE在多个指标上显著优于基线,验证了其优越性。
结果分析
具体数据表明,GRADE在CTR提升0.595%、CVR提升1.193%、订单量提升1.568%,远超静态加权方案。消融实验显示Dirichlet探索和复合奖励对性能提升至关重要,模型在冷启动和高维空间中表现优异,验证了其探索效率和稳定性。长时间部署后,持续优化用户体验,带来明显商业价值。
应用场景
该方法适用于大型电商、内容推荐、搜索引擎等场景,能动态调节多目标权重,提升个性化体验。部署前需收集丰富用户行为数据,训练基础模型,再进行强化微调。未来可结合多模态信息,扩展到多任务、多目标的多场景应用,推动行业智能化升级。
局限与展望
模型依赖大量反馈数据,冷启动场景效果有限。Dirichlet探索在高维空间计算成本较高,需优化采样策略。当前模型主要验证于特定场景,泛化到其他任务仍需验证。未来需提升探索效率和模型泛化能力,降低训练成本。
通俗解读 非专业人士也能看懂
想象你在厨房里做饭,要准备各种调料:盐、糖、酱油。每次做菜时,你会根据不同的菜式调整调料的比例。有些菜需要多点盐,有些则少点。传统方法是用固定比例,不会变,结果可能不合口味。现在,假设你有一个智能助手,它能根据每次尝试的味道,学习哪种调料比例最好。它会试几种不同的组合,然后根据味道反馈,逐步调整到最合适的比例。这个助手用一种聪明的方式,既不需要复杂的厨艺评估,也能快速找到最佳调料组合。它还会考虑一些规则,比如盐不能太多,否则会太咸。这样,厨房里的菜就能不断变得更好吃,满足不同客人的口味。这就像论文中的GRADE方法,用智能算法不断调整多目标的权重,让推荐系统更懂用户,提供个性化的内容。
简单解释 像给14岁少年讲一样
想象你在学校里参加一个比赛,要用不同的技能赢得评委的喜爱。每次比赛后,你都想知道哪些技能表现得更好,然后下次多用那些技能。以前,你会用一种固定的策略,比如每次都用一样的技能组合,结果不一定最好。现在,有个聪明的哥哥,他会观察每次比赛的结果,然后试几种不同的技能组合,看看哪种更受评委喜欢。他会用一种特别的数学方法,确保每次试的技能组合都合理,不会偏离太多。他还会根据评委的反馈,调整策略,让自己变得更厉害。这样,他每次都能学到更好的技能搭配,变得越来越强。这就像论文里的GRADE方法,用智能算法不断试验和调整,让推荐系统更懂你,给你喜欢的内容。它就像一个聪明的朋友,总是在学习怎么让你开心!
原文摘要
Balancing multiple objectives is critical for user satisfaction in modern recommender and search systems, yet current Multi-Task Fusion (MTF) methods rely on static, manually-tuned weights that fail to capture individual user intent. While Reinforcement Learning (RL) offers a path to personalization, traditional approaches often falter due to training instability and the sparse rewards inherent in these large-scale systems. To address these limitations, we propose Group-relative Reinforcement learning with Adaptive Dirichlet Exploration (GRADE), a novel and robust framework for personalized multi-task fusion. GRADE leverages a critic-free, Group Relative Policy Optimization (GRPO) paradigm, enabling stable and efficient policy learning by evaluating the relative performance of candidate weight groups. Its core innovations include employing the Dirichlet distribution for principled and structured exploration of the weight space, and a composite reward function that combines sparse user feedback with dense model priors and rule-based constraints to guide the search effectively. Deployed in the in-app marketplace of an application with over hundreds of millions daily active users, GRADE significantly outperforms established baselines, achieving substantial gains in rigorous large-scale A/B tests: +0.595\% in CTR, +1.193\% in CVR, +1.788\% in OPM, and +1.568\% in total order volume. Following its strong performance, GRADE has been fully deployed in the marketplace search scenario of Kuaishou, serving hundreds of millions of users.