ROCS: Request-Oriented Compute Sharing for Efficient Large-Scale Recommendation

TL;DR

ROCS通过延迟请求-候选交互提高推荐效率,提升3倍QPS。

cs.LG 🔴 高级 2026-07-30 7 次浏览
Yuxin Chen Liang Luo Buyun Zhang Jian Jiao Boda Li Haoyu Wang Tongyi Tang Ao Cai Zijian Shen Zhengkai Zhang Wenyi Xie Ryan Dick Han Liu Neng Shi Bin Yu Jianbo Xiao Shuyao Bi Hongtao Yu Yuanwei Fang Zhuoran Zhao Sijia Chen Yang Chen Shuqi Yang Qianru Li Zikun Liu Wei Ling Sihan Zeng Longhao Jin Jiaxin Lu Yinbin Ma Jiawei Li Yichen Ruan Yong Ler Lee Birmingham Guan Zijian Li Jianbo Sun Zhengyu Zhang Zeliang Chen Xiaohan Wei Yuchen Hao GP Musumeci Venkatesh Ranganathan Yantao Yao Chunqiang Tang Wenlin Chen Santanu Kolay Ellie Dingqiao Wen
推荐系统 计算共享 效率优化 模型部署 GPU加速

核心发现

方法论

ROCS通过推迟请求-候选交互,隔离候选依赖表示,使用通用层屏蔽(GLM)和深度交叉注意力(DCA)提高推理效率。IKBO用于GPU加速。

关键结果

  • 在生产规模工作负载中,ROCS在检索模型上实现了3倍QPS提升,无质量下降,并在短视频排名模型上实现了0.5% LogLoss改善和50% QPS提升。
  • 实验表明,ROCS在多个推荐骨干上提高了质量-效率平衡。
  • ROCS在广告和有机系统中部署,跨越检索和排名阶段,显著降低基础设施成本。

研究意义

ROCS通过计算共享显著提高了推荐系统的推理效率,解决了生产成本限制问题,并在不损失预测质量的情况下提高了系统的可扩展性。

技术贡献

ROCS提供了一种新的推理范式,通过GLM和DCA实现了候选隔离和请求共享,结合IKBO实现了高效的GPU执行。

新颖性

ROCS首次系统性地利用推荐推理中的请求共享特性,推迟请求-候选交互以最大化可重用计算。

局限性

  • ROCS可能在某些情况下无法处理实时性要求较高的场景。
  • 模型可能需要针对不同的推荐场景进行调整。

未来方向

未来工作可探索ROCS在其他领域的应用,如实时广告推荐,并进一步优化IKBO以支持更复杂的模型结构。

AI 总览摘要

现代推荐模型通过扩展特征交互和序列模块来提高预测质量,但生产成本限制了系统的扩展能力。ROCS提出了一种请求导向的计算共享范式,通过推迟请求-候选交互,隔离候选依赖表示,显著提高了推理效率,同时保持或提高预测质量。ROCS开发了通用层屏蔽(GLM)和深度交叉注意力(DCA)以支持序列架构的请求共享。为了支持高效的GPU部署,ROCS与内核广播优化(IKBO)共同设计,显著加速了模型执行。实验表明,ROCS在多个推荐骨干上提高了质量-效率平衡。在生产规模工作负载中,ROCS在检索模型上实现了3倍QPS提升,无质量下降,并在短视频排名模型上实现了0.5% LogLoss改善和50% QPS提升。ROCS已在广告和有机系统中部署,跨越检索和排名阶段,显著降低基础设施成本。ROCS通过计算共享显著提高了推荐系统的推理效率,解决了生产成本限制问题,并在不损失预测质量的情况下提高了系统的可扩展性。未来工作可探索ROCS在其他领域的应用,如实时广告推荐,并进一步优化IKBO以支持更复杂的模型结构。

深度分析

研究背景

推荐系统近年来发展迅速,尤其是在特征交互和序列建模方面。传统方法如模型统一和知识转移虽有效,但受限于域干扰和新鲜度要求。ROCS通过推迟请求-候选交互,隔离候选依赖表示,显著提高了推理效率。

核心问题

推荐系统的扩展受限于生产成本和延迟。如何在不损失预测质量的情况下提高推理效率是一个关键问题。

核心创新

ROCS通过推迟请求-候选交互,隔离候选依赖表示,使用GLM和DCA提高推理效率。IKBO用于GPU加速,显著降低了基础设施成本。

方法详解

  • �� 使用GLM实现候选隔离。
  • �� 使用DCA扩展请求共享到序列架构。
  • �� 结合IKBO实现高效GPU执行。

实验设计

实验使用公开基准和生产规模工作负载,评估ROCS在多个推荐骨干上的质量-效率平衡。主要指标包括QPS和LogLoss。

结果分析

ROCS在检索模型上实现了3倍QPS提升,无质量下降,并在短视频排名模型上实现了0.5% LogLoss改善和50% QPS提升。

应用场景

ROCS已在广告和有机系统中部署,跨越检索和排名阶段,显著降低基础设施成本。

局限与展望

ROCS可能在某些情况下无法处理实时性要求较高的场景。模型可能需要针对不同的推荐场景进行调整。

通俗解读 非专业人士也能看懂

想象一个大型超市,顾客在购物时需要选择许多商品。传统推荐系统就像每次顾客询问时都重新计算所有商品的价格和优惠信息,而ROCS则像提前计算好顾客的购物清单,只需在顾客询问时快速匹配商品信息。这种方法不仅节省了时间,还提高了效率。

简单解释 像给14岁少年讲一样

嘿,想象一下你在玩游戏,每次你要选择一个角色时,游戏都要重新加载所有角色的信息。这很慢,对吧?ROCS就像游戏提前加载好所有角色的信息,只需在你选择时快速匹配,这样游戏运行得更快!是不是很酷?

术语表

ROCS (请求导向计算共享)

一种推理范式,通过推迟请求-候选交互提高效率。

用于提高推荐系统的推理效率。

GLM (通用层屏蔽)

实现候选隔离的技术。

用于特征交互架构中。

DCA (深度交叉注意力)

扩展请求共享到序列架构的技术。

用于序列建模。

IKBO (内核广播优化)

一种GPU加速技术。

用于加速ROCS模型执行。

QPS (每秒查询数)

衡量系统处理能力的指标。

用于评估推荐系统的效率。

开放问题 这项研究留下的未解疑问

  • 1 如何在实时性要求较高的场景中应用ROCS?
  • 2 如何进一步优化IKBO以支持更复杂的模型结构?

应用场景

近期应用

广告推荐

ROCS可用于实时广告推荐,提高系统效率。

远期愿景

复杂模型支持

未来可探索ROCS在更复杂模型中的应用。

原文摘要

Modern recommendation models gain prediction quality by scaling feature-interaction and sequence modules, but production cost constraints cap how far systems can scale. In this work, we propose Request-Oriented Compute Sharing (ROCS), a modeling and inference paradigm that exploits a unique property of recommendation inference: each user request is evaluated against many candidates, while request-side features are shared across candidates. ROCS defers request-candidate interactions as late as possible, isolates candidate-dependent representations, and evaluates substantial portions of the model once per request rather than once per candidate, significantly improving inference efficiency while maintaining or improving prediction quality. To realize this paradigm, we develop Generalized Layer Masking (GLM) to enforce candidate isolation in feature-interaction architectures, and Deep Cross Attention (DCA) to extend request-oriented sharing to sequence architectures. To support efficient GPU deployment, we co-design In-Kernel Broadcast Optimization (IKBO) that significantly accelerates ROCS model execution. Experiments on public benchmarks show that ROCS consistently improves the quality-efficiency tradeoff across recommendation backbones. On production-scale workloads, ROCS achieves up to a 3x QPS improvement on retrieval models without quality degradation and a 0.5% relative LogLoss improvement with a 50% QPS gain on a short-form video ranking model. ROCS has been deployed across large-scale recommendation systems spanning ads and organic surfaces, retrieval and ranking stages, and more than two orders of magnitude in inference complexity, delivering significant online gains at reduced infrastructure cost.

cs.LG cs.AI cs.IR