Multi-Objective Ranking for Live-Streaming: Balancing Fresh and Delayed Signals with Segment-Aware Targeting

TL;DR

提出多目标排序模型,结合即时与延迟信号,采用Segment-Aware策略,提升Twitch直播推荐的DAU和ARPU,参数减少41.9%。

cs.IR 🔴 高级 2026-08-05 126 次浏览
Xiaoyi Gu Julia Tavares Eder Santana Carlos Mendoza-Cardenas Nikita Mishra Saad Ali
推荐系统 多目标优化 直播推荐 深度学习 多任务学习

核心发现

方法论

本文提出结合延迟窗口、多模型架构和Segment-Aware策略的多目标排序框架,利用Multi-gate Mixture-of-Experts (MMoE)实现深层目标联合建模,优化直播推荐中的即时互动、留存和变现指标。系统通过延迟窗口扩展反馈收集,缓解行为稀疏与延迟问题;多模型架构实现即时信号(FSM)与延迟信号(DSM)结合;Segment-Aware模块根据用户生命周期阶段调整排名策略;MMoE模型通过专家门控机制,参数减少41.9%。模型在Twitch平台大规模在线A/B测试中验证,显著提升DAU、付费用户行为和新用户增长,系统响应延迟低于110ms。

关键结果

  • 在Twitch推荐系统中,采用多模型+延迟窗口架构,DAU提升0.09%,带来数百万的年度活跃天数增长;高活跃用户的ARPU提升0.56%。
  • 引入Viewer Segment Targeting(VST)后,针对新手和低活跃用户,DAU提升0.15%;MMoE模型整体提升DAU 0.08%,新增关注数提升0.27%。
  • 在Twitch移动端直播推荐中,架构实现正向用户互动(点击、关注、点赞)提升1.12%,验证了模型的泛化能力。

研究意义

该研究突破了直播推荐中行为稀疏、延迟反馈和用户偏差的难题,提出的多目标排序框架兼顾即时互动、用户留存和商业变现,为大规模实时推荐系统提供了可扩展的解决方案。通过引入多模型和Segment-Aware策略,有效平衡不同用户群体的需求,推动直播平台的用户增长和收入提升,具有重要的理论和工业价值。

技术贡献

本研究在多目标优化中引入延迟窗口、多模型融合和Segment-Aware策略,创新性地结合MMoE模型实现多目标联合建模,参数减少41.9%,显著提升模型效率。系统设计兼顾实时性与多目标平衡,提出低延迟、可扩展的推荐架构,解决直播场景中行为延迟和偏差问题。

新颖性

首次在直播推荐中系统性引入延迟窗口、多模型架构与Segment-Aware策略,结合MMoE模型实现多目标联合优化,突破了传统单目标或静态多目标模型的局限,显著改善了行为稀疏和偏差问题。

局限性

  • 模型依赖大量历史行为数据,可能在新用户冷启动时表现不足,且对极端偏差用户的适应性有限。
  • 系统在极端高并发场景下仍需优化,确保低延迟响应,未来需结合更高效的模型压缩技术。
  • 当前模型主要针对Twitch平台,迁移到其他直播平台或不同内容类型时需进行适配和调优。

未来方向

未来将探索强化学习在多目标排序中的应用,结合用户实时反馈动态调整模型权重;同时,考虑引入更细粒度的用户分层策略,提升个性化推荐效果;此外,将结合多模态信息(如视频内容、语音情感)丰富特征表达,进一步优化推荐质量。

AI 总览摘要

直播推荐系统面临行为稀疏、延迟反馈和用户偏差等多重挑战。传统单一指标优化难以兼顾用户即时互动和长期留存,限制了平台的增长潜力。本文提出一种创新的多目标排序框架,结合延迟窗口、多模型融合和Segment-Aware策略,有效应对直播场景中的复杂需求。

核心思想是将即时信号(如观看时长)与延迟行为(如关注、打赏)分离建模,通过延迟窗口扩展反馈收集范围,缓解行为稀疏问题。引入多模型架构,分别训练即时信号模型(FSM)和延迟信号模型(DSM),在推理时融合两者,兼顾新鲜偏好与历史行为。为应对不同用户生命周期阶段的需求,设计了Segment-Aware策略,根据用户的活跃度和新旧程度调整排名权重。

在模型层面,采用Multi-gate Mixture-of-Experts(MMoE)架构,将深层目标(如留存和变现)联合建模,参数减少41.9%,提升模型效率。系统在Twitch平台大规模在线A/B测试中表现出显著优势:DAU提升0.09%,带来数百万的年度活跃天数增长;高活跃用户的ARPU提升0.56%。引入VST后,针对新手和低活跃用户,DAU再提升0.15%;整体DAU增加0.08%,新关注数增加0.27%。此外,在移动端直播推荐中,用户互动提升1.12%,验证了模型的泛化能力。

该研究为直播推荐中的多目标优化提供了新思路,兼顾即时互动、用户留存和商业变现,具有广泛的工业应用前景。未来工作将结合强化学习、多模态信息和个性化策略,进一步提升推荐系统的智能化水平。

深度分析

研究背景

随着直播平台的快速发展,个性化推荐成为提升用户体验和平台盈利的关键。早期的推荐系统多关注单一目标,如观看时长或点击率,采用协同过滤和浅层神经网络模型。近年来,深度学习和多目标优化技术逐渐引入,诸如多任务学习(Multi-task Learning)和多目标优化(Multi-Objective Optimization, MOO)架构如MMoE(Multi-gate Mixture-of-Experts)被广泛应用于电商、视频推荐等场景,显著提升了模型的表现。然而,直播场景具有行为多样性、行为延迟和偏差等特殊挑战。用户行为包括观看、聊天、关注、打赏等多种形式,行为发生的时间和频率差异巨大,导致行为稀疏和反馈延迟问题突出。此外,训练数据偏向高活跃用户,冷启动用户和新用户的推荐效果不足,限制了平台的增长潜力。尽管已有研究在多目标优化和延迟反馈建模方面取得一定进展,但针对直播推荐的系统性解决方案仍缺乏,特别是在多行为、多目标和用户偏差的交叉影响下,优化策略亟需创新。

核心问题

直播推荐系统的核心难题在于行为稀疏与延迟反馈。高价值行为如关注和打赏发生频率极低,导致模型难以捕捉用户偏好。行为延迟意味着用户可能在几天甚至数周后才进行目标行为,造成训练数据的滞后和噪声。此外,用户偏差明显,活跃用户占据大部分训练样本,冷启动和新用户的推荐效果不足,影响平台的用户增长和留存。传统模型难以同时平衡即时互动和长期留存目标,且在多行为、多目标场景下表现有限。如何设计一个既能缓解行为稀疏,又能考虑用户生命周期差异的推荐框架,成为亟待解决的难题。

核心创新

本文的创新点主要体现在以下几个方面:

1) 延迟窗口机制:通过定义14天的延迟窗口,将稀疏的高价值行为(如关注、打赏)转化为密集的延迟信号,有效缓解行为稀疏问题。

2) 多模型架构:引入即时信号模型(FSM)和延迟信号模型(DSM),在推理阶段融合,兼顾新鲜偏好和历史行为,提升模型的适应性。

3) Segment-Aware策略:根据用户的生命周期阶段(新手或老用户)调整排名权重,解决用户偏差问题,实现个性化优化。

4) MMoE模型:采用Multi-gate Mixture-of-Experts架构,将深层目标(留存、变现)联合建模,参数减少41.9%,提升效率。

5) 实时性保障:系统设计响应延迟低于110ms,满足大规模实时推荐需求。这些创新共同推动直播推荐系统在多目标、多行为场景下的性能突破。

方法详解

  • �� 数据准备:采集Twitch平台上百万用户的行为数据,包括观看、聊天、关注、打赏等,定义短期(即时)和长期(延迟)行为指标。
  • �� 延迟窗口设计:为高价值行为定义14天的延迟窗口,将行为归入延迟信号,缓解稀疏问题。
  • �� 多模型训练:分别训练即时信号模型(FSM)和延迟信号模型(DSM),FSM利用实时行为,DSM利用延迟行为,两个模型在训练时同步优化。
  • �� Segment-Aware策略:根据用户的活跃度和新旧状态,赋予不同的模型输出不同的权重,调整排序偏向。
  • �� MMoE模型:构建多专家结构,联合建模深层目标(留存、变现)与浅层目标(即时互动),通过门控机制实现目标间的知识共享。
  • �� 推理融合:在推荐时,将FSM、DSM和MMoE的预测结果结合,利用Segment-Aware策略调整最终排序得分。
  • �� 系统优化:确保模型推理延迟低于110ms,支持大规模在线服务。
  • �� 实验验证:通过离线分析和线上A/B测试,评估模型在DAU、ARPU和新用户增长等指标上的提升效果。

实验设计

实验采用Twitch平台的真实行为数据,涵盖百万用户的多行为记录。模型训练分为离线阶段和线上A/B测试两个环节。离线分析中,比较不同延迟窗口大小(7、14、21、28、35天)对高价值行为的正样本比例影响,确定最优窗口。线上A/B测试中,将提出的多模型+Segment-Aware架构与基线模型(单一排序模型)进行对比,指标包括每日活跃用户数(DAU)、高价值行为(关注、新关注)、付费用户的ARPU等。模型超参数如专家数量、门控机制参数、模型复杂度等经过调优。还进行了消融实验,验证延迟窗口、多模型、Segment-Aware策略对性能的贡献。

结果分析

在Twitch平台,采用延迟窗口和多模型架构的系统,DAU提升0.09%,带来数百万的年度活跃天数增长。引入VST后,针对新手和低活跃用户,DAU再提升0.15%。整体DAU提升0.08%,新关注数提升0.27%。在移动端直播推荐中,用户正向互动(点击、关注、点赞)提升1.12%。模型参数相比传统模型减少41.9%,同时保持低延迟(响应时间低于110ms)。这些结果表明,结合延迟信号、多模型和Segment-Aware策略,显著改善了直播推荐的多目标性能,验证了方法的实用性和有效性。

应用场景

该模型架构适用于大型直播平台的实时推荐系统,能同时优化用户即时互动、留存和变现目标。平台可以根据用户生命周期阶段动态调整推荐策略,提升新用户转化和老用户留存。系统的低延迟特性保证了大规模用户的实时体验,适合在高并发环境中部署。未来,结合多模态内容分析和强化学习,可进一步提升推荐的个性化和智能化水平,推动直播行业的持续创新。

局限与展望

模型在极端冷启动或新用户场景下表现仍有限,主要由于缺乏历史行为数据。系统对高峰期的高并发响应能力需持续优化,确保低延迟。此外,模型依赖大量历史数据,训练成本较高,迁移到其他平台或内容类型时需进行调优。未来还需解决多目标权重动态调整的问题,以适应不同业务需求的变化。

通俗解读 非专业人士也能看懂

想象你在一家大型厨房里准备一道复杂的菜肴。每个厨师负责不同的部分:有的专门切菜,有的负责炒菜,还有的负责调味。为了做出美味的菜肴,厨师们需要协调合作,但每个人的工作节奏不同,有的动作快,有的慢。有时候,厨师们会提前准备一些调料(即时信号),有时候则需要等待食材成熟(延迟反馈)。为了让菜肴尽善尽美,厨师们还要根据不同的菜肴类型(用户阶段)调整调料的用量。这个厨房的管理者设计了一套智能系统,能同时协调所有厨师的工作,确保每个环节都在最佳时间完成,最终端出一道色香味俱佳的菜。这就像本文提出的直播推荐系统,结合了即时和延迟信息,利用不同的模型和策略,优化用户体验和商业目标。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,里面有很多不同的任务,比如收集宝藏、打怪、交朋友。每个任务的完成时间都不一样,有些任务可以马上完成(比如找到一个宝箱),有些则需要等待很久(比如建立一个朋友关系)。如果你只看眼前的宝箱,可能会错过更重要的宝藏,但如果只等很久,你又会错过很多有趣的事情。这个游戏的设计者发明了一套聪明的策略,既关注眼前的宝箱,也会等待一段时间,看看会不会出现更好的宝藏。还会根据你的等级(新手或老玩家)调整策略,确保你既能快速获得奖励,又能长久玩得开心。这个策略让游戏变得更有趣,也让你更容易取得好成绩。

术语表

多目标优化 (Multi-Objective Optimization)

一种同时优化多个目标的方法,旨在在不同目标间找到最佳折衷方案。技术上通过权重调整或Pareto前沿实现目标平衡。

本文中用于平衡即时互动、留存和变现目标。

延迟窗口 (Delayed Window)

定义一段时间范围,用于收集行为反馈,缓解行为稀疏和延迟反馈问题。通常为14天或更长时间。

用于将高价值行为的反馈延后处理,增强信号密度。

Multi-gate Mixture-of-Experts (MMoE)

一种多任务学习架构,通过门控机制实现专家网络的动态组合,支持多目标联合建模。

本文用以同时建模深层目标如留存和变现。

Segment-Aware策略

根据用户的生命周期阶段(新手或老用户)调整模型输出的权重,实现个性化优化。

缓解用户偏差,提升不同用户群体的推荐效果。

即时信号模型 (FSM)

专门捕获用户即时行为(如观看时长)的模型,反映用户当前偏好。

在系统中独立训练,用于快速响应。

延迟信号模型 (DSM)

利用延迟反馈(如关注、打赏)训练的模型,缓解行为稀疏问题。

结合延迟窗口,增强高价值行为的信号。

推荐系统 (Recommendation System)

通过分析用户行为和偏好,为用户提供个性化内容的算法系统。

本文的核心应用场景。

DAU (Daily Active Users)

每日活跃用户数,是衡量平台用户活跃度的重要指标。

用以评估推荐系统的实际效果。

ARPU (Average Revenue Per User)

每用户平均收入,反映平台盈利能力。

衡量变现效果的关键指标。

冷启动 (Cold Start)

新用户或新内容缺乏历史行为数据,导致推荐效果受限的场景。

模型在冷启动时的表现是未来研究重点。

多任务学习 (Multi-task Learning)

同时训练多个相关任务,共享模型参数,提高整体性能。

实现多目标优化的基础技术。

反馈延迟 (Feedback Delay)

用户行为反馈与内容曝光之间存在时间差,影响模型训练和优化。

直播推荐中的核心挑战之一。

偏差 (Bias)

训练数据或模型输出中存在的系统性偏向,影响推荐公平性和效果。

需通过Segment-Aware策略缓解。

参数效率 (Parameter Efficiency)

在保证模型性能的前提下,减少模型参数数量,提高计算效率。

本文通过MMoE实现参数减少。

实时推荐 (Real-time Recommendation)

在用户交互瞬间生成个性化内容,要求低延迟和高并发支持。

系统设计的核心目标。

开放问题 这项研究留下的未解疑问

  • 1 当前模型在极端冷启动用户的表现仍有限,未来需结合内容特征和用户画像进行更有效的冷启动策略。
  • 2 多目标权重的动态调整机制尚未完善,如何根据实时业务需求自动调节目标优先级仍是挑战。
  • 3 多模态信息(如视频内容、语音情感)未充分利用,未来结合多模态特征可能带来更优推荐效果。
  • 4 模型在高峰时段的响应速度和稳定性需要持续优化,确保系统在极端负载下依然高效。
  • 5 迁移到不同内容平台或不同国家地区时,模型的适应性和泛化能力仍需验证。

应用场景

近期应用

直播内容个性化推荐

平台可利用该架构实时调整推荐内容,提升用户互动和留存,尤其适合大规模直播平台如Twitch。

新用户引导与激活

通过Segment-Aware策略,针对新用户提供更偏向即时互动的内容,促进快速转化。

多目标商业优化

同时优化用户体验和变现指标,为平台带来持续增长。

远期愿景

智能内容调度系统

结合多模态信息和强化学习,打造全自动、个性化的内容调度平台,推动行业智能化升级。

跨平台推荐生态

将模型迁移到不同内容类型和平台,形成统一的多场景推荐体系,提升行业整体效率。

原文摘要

One of the most challenging problems entertainment live-streaming services face in recommendation systems is that user behaviors are sparse and delayed, and interaction data exhibits bias for different user segments. Unlike e-commerce applications where user actions follow linear sequences, live-streaming viewers engage in multiple concurrent behaviors of watching, chatting, following, and spending, each occurring with varying delays. We address these challenges through three key contributions: 1) a delayed window approach that extends feedback collection beyond immediate responses, 2) a multi-model architecture that combines fresh and delayed signals, and a segment-aware targeting module that optimizes ranking scores differently across user lifecycle stages, and 3) Multi-gate Mixture-of-Experts (MMoE) integration that jointly models correlated targets while reducing model parameters by 41.9% compared to independent models. Online A/B testing demonstrates significant improvements, including a +0.09% increase in Daily Active Viewers (DAV), generating millions more annual active viewer days, and +0.56% increase in highly engaged viewers' capped Average Revenue Per User (ARPU). Viewer-segment targeting achieved an additional +0.15% DAV improvement for newer and less engaged viewers, while MMoE enhancement added +0.08% overall DAV and +0.27% new follows. The proposed system processes ranking requests with low latency, providing a scalable approach for balancing multiple business objectives across diverse user populations. In addition, we tested the multi-model architecture on the Twitch mobile live feed and achieved a +1.12% increase in positive user-channel interactions (clicks, follows, and likes), demonstrating applicability beyond the primary use case.

cs.IR cs.LG

参考文献 (20)

Progressive Layered Extraction (PLE): A Novel Multi-Task Learning (MTL) Model for Personalized Recommendations

Hongyan Tang, Junning Liu, Ming Zhao 等

2020 795 引用 ⭐ 高影响力

Practical Multi-Task Learning for Rare Conversions in Ad Tech

Yuval Dishi, Ophir Friedler, Yonatan Karni 等

2025 3 引用 查看解读 →

GradCraft: Elevating Multi-task Recommendations through Holistic Gradient Crafting

Yimeng Bai, Yang Zhang, Fuli Feng 等

2024 7 引用 查看解读 →

Unbiased Learning to Rank with Unbiased Propensity Estimation

Qingyao Ai, Keping Bi, Cheng Luo 等

2018 277 引用 查看解读 →

Personalized Approximate Pareto-Efficient Recommendation

Ruobing Xie, Yanlei Liu, Shaoliang Zhang 等

2021 51 引用

Recommending what video to watch next: a multitask ranking system

Zhe Zhao, Lichan Hong, Li Wei 等

2019 423 引用

Recommendations as Treatments: Debiasing Learning and Evaluation

Tobias Schnabel, Adith Swaminathan, Ashudeep Singh 等

2016 855 引用 查看解读 →

Ensure Timeliness and Accuracy: A Novel Sliding Window Data Stream Paradigm for Live Streaming Recommendation

Fengqi Liang, Baigong Zheng, Liqin Zhao 等

2024 12 引用 查看解读 →

A Nonparametric Delayed Feedback Model for Conversion Rate Prediction

Yuya Yoshikawa, Yusaku Imai

2018 56 引用 查看解读 →

Improving the sensitivity of online controlled experiments by utilizing pre-experiment data

Alex Deng, Ya Xu, Ron Kohavi 等

2013 282 引用

SEMORec: A Scalarized Efficient Multi-Objective Recommendation Framework

S. M. Nikolakaki, Siyong Ma, S. Chennu 等

2025 1 引用

Modeling Task Relationships in Multi-task Learning with Multi-gate Mixture-of-Experts

Jiaqi W. Ma, Zhe Zhao, Xinyang Yi 等

2018 1692 引用

Modeling delayed feedback in display advertising

O. Chapelle

2014 206 引用

Pareto-Optimal Solution: Optimizing Engagement and Revenue

Shaghayegh Agah, Shaun Schaeffer, Maria Peifer 等

2025 2 引用

Paragon: Parameter Generation for Controllable Multi-Task Recommendation

Chenglei Shen, Jiahao Zhao, Xiao Zhang 等

2024 6 引用 查看解读 →

OneLive: Dynamically Unified Generative Framework for Live-Streaming Recommendation

Shenghui Wang, Yusheng Huang, Ruochen Yang 等

2026 9 引用 查看解读 →

Multi-Objective Recommendation via Multivariate Policy Learning

Olivier Jeunen, Jatin Mandav, Ivan Potapov 等

2024 15 引用 查看解读 →

An Overview of Multi-Task Learning in Deep Neural Networks

Sebastian Ruder

2017 3328 引用 查看解读 →

Debiasing Item-to-Item Recommendations With Small Annotated Datasets

Tobias Schnabel, Paul N. Bennett

2020 20 引用

Deep Neural Networks for YouTube Recommendations

Paul Covington, Jay K. Adams, Emre Sargin

2016 3985 引用