LASER: An Efficient Target-Aware Segmented Attention Framework for End-to-End Long Sequence Modeling

TL;DR

LASER用SeqVault+STA/GSTA实现超长序列低延迟CTR建模,线上ADVV+2.36%、收入+2.08%。

cs.IR 🔴 高级 2026-02-12 40 次浏览
Tianhe Lin Ziwei Xiong Baoyuan Ou Yingjie Qin Lai Xu Xiaocheng Zhong Yao Hu Zhiyong Wang Tao Zhou Yubin Xu Di Wu
长序列推荐 工业系统 目标感知注意力 低延迟服务 点击率预测

核心发现

方法论

LASER把“系统”与“算法”同时优化:SeqVault用DRAM-SSD混合索引、schema-aware存储统一管理全生命周期行为序列;模型侧用STA先在固定窗口内做目标感知压缩,再用GSTA在压缩后的段级序列上建模跨段依赖;最后结合max pooling与最近r段,经RankMixer做CTR预测,损失为二元交叉熵。

关键结果

  • 在线A/B测试覆盖超过1亿DAU,LASER带来ADVV提升2.36%、收入提升2.08%,说明其不仅在离线指标上有效,也能稳定转化为真实业务收益。
  • SeqVault把检索延迟降低50%、CPU占用降低75%,并支持毫秒级访问全量实时与生命周期用户历史;论文还指出训练资源消耗可降低10倍。
  • 离线实验中,LASER持续优于现有SOTA基线;消融表明,sigmoid门控的STA优于标准softmax压缩,GSTA能在低成本下补足跨段信息。

研究意义

这项工作直接回应了工业推荐中的“Latency Wall”:一边是超长用户序列带来的I/O与存储压力,一边是标准自注意力的O(L²)计算瓶颈。LASER证明,超长序列并不一定只能靠“截断”或“两阶段检索”来处理,也可以在端到端框架内保留生命周期行为信号,并在真实线上环境中获得可观收益。

技术贡献

技术贡献有两层。系统层面,SeqVault把分散的short-term lastN、long-term lastN与多场景side info统一到同一服务,靠DRAM索引+SSD存储+序列级merge降低尾延迟和磁盘浪费。算法层面,STA用低维投影与sigmoid静默机制实现“压缩而不盲目分配注意力”,GSTA再以堆叠目标注意力恢复段间交互,形成“compress-then-refine”的高效长序列建模范式。

新颖性

新颖性不只在“更长”,而在“全栈闭环”。相较DIN、SIM等依赖短序列或两阶段筛选的方法,LASER把目标感知压缩、全局精炼与在线服务基础设施合并为一个可部署方案;相较常规softmax注意力,它显式允许无关段输出接近0,减少噪声放大。

局限性

  • 论文主要基于小红书的工业场景与内部数据验证,公开部分未给出离线数据集名称、规模细节和完整超参数,因此外部复现与横向比较仍受限制。
  • STA依赖固定窗口分段w与最近r段等设计,若用户兴趣切换极快或行为序列结构高度不均匀,固定分段可能并非最优。
  • SeqVault与GSTA都面向高工程投入环境,迁移到资源受限平台时,混合存储、索引维护与分布式通信优化的收益未必同样显著。

未来方向

作者已指向多场景统一建模这一方向。后续可进一步研究自适应分段、动态窗口、跨模态行为统一压缩,以及在更多推荐、搜索和广告任务上的可迁移性与稳健性评估。

AI 总览摘要

LASER瞄准的是现代推荐系统里最棘手的现实问题:用户行为序列越来越长,但线上系统不能慢。传统短序列模型常把历史压缩到最近百余步,信息丢失明显;两阶段长序列方案则先筛再算,往往在检索阶段就把终身兴趣“筛没了”。在小红书这样拥有海量内容互动、搜索、购物行为的场景中,这种“Latency Wall”尤为突出,因为既要读到全量历史,又要在毫秒级完成排序。

为此,LASER把系统和模型一起重做。SeqVault负责序列服务:用DRAM做哈希索引、SSD做大容量存储,并以schema-aware方式统一多场景side info与用户历史,替代过去碎片化的RedLastN流程。模型侧则采用“compress-then-refine”:STA先在固定窗口内用目标相关的低维Q/K/V做压缩,sigmoid门控充当静默机制,把噪声行为尽量压到接近0;随后GSTA在压缩后的段级序列上堆叠建模跨段依赖,再把全局表示、max pool和最近r段特征送入RankMixer。

结果非常直接:SeqVault把检索延迟降50%、CPU降75%,训练资源消耗降低10倍;在线A/B测试覆盖超过1亿DAU,ADVV提升2.36%,收入提升2.08%。这说明LASER不是只在离线AUC上“好看”,而是真正把超长序列建模转化成了业务增长。更重要的是,它给工业界提供了一条可部署路径:不再在“保信息”和“保速度”之间二选一,而是通过端到端架构同时兼顾两者。

深度分析

研究背景

推荐系统从DIN、GRU4Rec一类短序列建模,逐步走向SIM、离线表征与长序列直接建模。问题在于,用户历史已不只是最近点击,而是跨搜索、内容、商品等多场景的生命周期轨迹;若只保留短窗,会丢失长期偏好与兴趣漂移。

核心问题

核心难点有两个:一是取数慢,长历史带来磁盘I/O、网络与序列拼接开销;二是算得慢,标准自注意力复杂度为O(L²)。两阶段检索虽能减长,但硬筛选或相似度召回会造成不可逆信息损失,难以精准服务目标item。

核心创新

LASER的创新是“服务+算法”双轮驱动。SeqVault统一承载多场景历史,并用混合DRAM-SSD索引解决访问瓶颈;STA用sigmoid而非softmax做段内目标感知聚合,允许无关行为“沉默”;GSTA再在压缩序列上做深层目标注意力,恢复跨段语义。三者组合成可在线部署的全栈方案。

方法详解

  • �� 输入:从SeqVault取出用户序列H={h1...hL}、目标item t,以及ID、多模态embedding、相似度、recency等side info。
  • �� 分段:用split_seq(H,w)把序列切成L'个不重叠窗口,每段w个token,先隔离噪声再做局部聚合。
  • �� STA:Q=tWq,K=SiWk,V=SiWv,s_i=Sigmoid(QK^T/γ)V;用低维投影d_q≪d降低计算,并用sigmoid静默机制避免softmax强制分配权重。
  • �� 段内增强:s_i经FFN与LN提升表达力,得到压缩段表示H'。
  • �� GSTA:在H'上堆叠L_stack层,a_l=softmax((t_{l-1}W_q^l)(H'W_k^l)^T/√d),o_l=a_l(H'W_v^l),t_l=t_{l-1}+o_l。
  • �� 融合:拼接z、max_pool(H')与最近r段,输入RankMixer,目标函数为式(2)的BCE。

实验设计

论文报告了两类评估。离线侧,LASER与现有长序列/短序列基线比较,指标以AUC等CTR指标为主,但公开节选未完整列出数据集名称。在线侧,在小红书主站广告排序场景进行A/B测试,覆盖超1亿DAU,并对业务指标ADVV与收入做端到端验证。同时还评估了SeqVault的检索延迟、CPU占用和训练资源消耗。

结果分析

最强结果来自线上:ADVV +2.36%、收入 +2.08%,说明模型优化最终转化为商业收益。基础设施上,SeqVault将检索延迟降50%、CPU降75%,并支持毫秒级访问全量历史。方法上,STA与GSTA的分工清晰:前者压缩去噪,后者补足全局依赖;消融显示这种分工优于单纯softmax或仅局部建模。

应用场景

最直接的应用是广告CTR排序、内容推荐和多场景统一用户建模。凡是需要读取全生命周期历史、又必须在线毫秒响应的系统,都可采用LASER式分层存储与压缩注意力。其前提是有稳定的行为日志、统一的特征schema与可承受的GPU/CPU混合部署环境。

局限与展望

局限主要在可迁移性与公开性。首先,实验数据主要来自小红书工业环境,外部数据集与完整配置未公开。其次,固定分段和窗口大小需要人工设定,对剧烈兴趣切换用户可能不够自适应。最后,系统收益依赖混合存储与服务改造,落地成本不低。

通俗解读 非专业人士也能看懂

把LASER想成一家超忙的大餐厅。顾客的点餐历史像一大叠账单,最早的、最近的、不同分店的都堆在一起。如果厨师每次都把所有账单从头翻到尾,肯定会慢;可如果只看最近几张,又会忘记老顾客长期爱吃什么。LASER先把账单分成一小叠一小叠,每叠里先把明显没用的信息轻轻“静音”,再把每叠提炼成一句话,最后再把这些一句话重新拼起来看全局。这样既不会被杂乱信息淹没,也不会丢掉重要线索。SeqVault就像一个又快又整齐的仓库,常用的单子放门口,老单子放大仓库里,所以找得快、占地方少。结果就是,餐厅出菜更快,还更懂老顾客口味。

简单解释 像给14岁少年讲一样

想象你在玩一个超大型游戏,系统要根据你从小到大的所有操作来猜你下一步想干嘛。要是只看最近10次操作,当然很快,但你以前练过什么职业、常用什么打法,全没了;要是把所有操作都硬塞进去,游戏又会卡爆。LASER的聪明之处,就是先把一长串操作分成很多小段,每段先判断“这段是不是跟当前目标有关”,没关系的就尽量忽略,有关系的才保留。然后它再把这些小段重新串起来,看看它们之间有没有隐藏联系。

更酷的是,LASER不只是模型厉害,连“翻历史记录”的仓库也一起升级了。SeqVault像一个超级整理柜:常用资料放前面,冷门资料放后面,但你都能很快找到。这样系统就不会因为找记录而拖慢。换句话说,它不是单纯让AI更聪明,而是让整个流程都更顺。

你可以把它理解成:先用放大镜找重点,再用拼图把重点拼成完整故事。这样一来,既不会错过你长期的“老习惯”,也不会被一堆没用的小动作干扰。对推荐系统来说,这真的很重要,因为它要猜的不是“你刚刚看了什么”,而是“你到底是谁、你真正喜欢什么”。

所以LASER为什么厉害?因为它同时解决了“看得全”和“跑得快”这两个矛盾。以前很多方法只能二选一:要么快但粗糙,要么准但太慢。LASER告诉我们,分段、静音、再精炼,可以两者兼得。

术语表

SeqVault(统一长序列服务)

这是LASER的序列存取基础设施,用来统一管理用户全生命周期行为和side info。技术上,它用DRAM-SSD混合索引和schema-aware存储降低检索延迟与磁盘浪费。

用于替代过去碎片化的RedLastN流程,并支撑实时训练与推理一致性。

STA / Segmented Target Attention(分段目标注意力)

它先把长序列切成固定窗口,再在每段内围绕目标item做注意力压缩。与softmax不同,它用sigmoid门控,可让无关行为接近“静音”。

用于式(5),完成段内压缩并生成段级表示s_i。

GSTA / Global Stacked Target Attention(全局堆叠目标注意力)

这是压缩后的二级建模模块,在段级序列上叠加多层目标注意力,恢复跨段依赖。它保留了全局交互能力,但计算成本远低于原始长序列自注意力。

用于式(7),输出最终全局向量z。

Silence mechanism(静默机制)

指sigmoid门控允许不相关token的权重自然趋近0,而不是像softmax那样必须分到概率质量。直观上,它像“允许模型装作没看见噪声”。

是STA抑制噪声、避免错误放大的关键设计。

RankMixer(特征交互层)

这是LASER后续的特征融合与排序模块,把序列表示和其他特征一起做高阶交互。它相当于最终的“裁判”,决定这些历史信号如何影响CTR预测。

LASER的z、max_pool(H')和最近r段特征都会送入RankMixer。

开放问题 这项研究留下的未解疑问

  • 1 公开文本未给出离线数据集名称、样本规模与完整超参数,难以判断LASER在公开基准上的可复现性与泛化边界。
  • 2 固定窗口分段w与最近r段的选择是否对所有用户都最优尚不明确;自适应分段或许能进一步提升对突发兴趣变化的响应。
  • 3 SeqVault带来的系统收益很强,但在中小规模或低算力环境下,混合存储与索引维护的性价比仍需单独验证。

应用场景

近期应用

广告CTR排序

适合需要读取全量历史、又必须毫秒级响应的广告排序系统。可直接把LASER接到现有特征交互层前端,提升对长期偏好与短期意图的联合建模能力。

内容/电商推荐

适合内容社区、电商和搜索推荐中的多场景用户建模。前提是统一日志schema,并能部署SeqVault式存储与STA/GSTA式序列编码。

远期愿景

多场景统一兴趣底座

长期上,LASER可演化为跨内容、广告、搜索、交易的统一兴趣表示层,逐步替代多个割裂的历史服务,形成更通用的终身用户理解框架。

原文摘要

Modeling ultra-long user behavior sequences is pivotal for capturing evolving and lifelong interests in modern recommendation systems. However, deploying such models in real-time industrial environments faces a strict "Latency Wall", constrained by two distinct bottlenecks: the high I/O latency of retrieving massive user histories and the quadratic computational complexity of standard attention mechanisms. To break these bottlenecks, we present LASER, a full-stack optimization framework developed and deployed at Xiaohongshu (RedNote). Our approach tackles the challenges through two complementary innovations: (1) System efficiency: We introduce SeqVault, a unified schema-aware serving infrastructure for long user histories. By implementing a hybrid DRAM-SSD indexing strategy, SeqVault reduces retrieval latency by 50% and CPU usage by 75%, ensuring millisecond-level access to full real-time and life-cycle user histories. (2) Algorithmic efficiency: We propose a Segmented Target Attention (STA) mechanism to address the computational overhead. Motivated by the inherent sparsity of user interests, STA employs a sigmoid-based gating strategy that acts as a silence mechanism to filter out noisy items. Subsequently, a lightweight Global Stacked Target Attention (GSTA) module refines these compressed segments to capture cross-segment dependencies without incurring high computational costs. This design performs effective sequence compression, reducing the complexity of long-sequence modeling while preserving critical signals. Extensive offline evaluations demonstrate that LASER consistently outperforms state-of-the-art baselines. In large-scale online A/B testing serving over 100 million daily active users, LASER achieved a 2.36% lift in ADVV and a 2.08% lift in revenue, demonstrating its scalability and significant commercial impact.

cs.IR