LASER: An Efficient Target-Aware Segmented Attention Framework for End-to-End Long Sequence Modeling
LASER用SeqVault+STA/GSTA实现超长序列低延迟CTR建模,线上ADVV+2.36%、收入+2.08%。
核心发现
方法论
LASER把“系统”与“算法”同时优化:SeqVault用DRAM-SSD混合索引、schema-aware存储统一管理全生命周期行为序列;模型侧用STA先在固定窗口内做目标感知压缩,再用GSTA在压缩后的段级序列上建模跨段依赖;最后结合max pooling与最近r段,经RankMixer做CTR预测,损失为二元交叉熵。
关键结果
- 在线A/B测试覆盖超过1亿DAU,LASER带来ADVV提升2.36%、收入提升2.08%,说明其不仅在离线指标上有效,也能稳定转化为真实业务收益。
- SeqVault把检索延迟降低50%、CPU占用降低75%,并支持毫秒级访问全量实时与生命周期用户历史;论文还指出训练资源消耗可降低10倍。
- 离线实验中,LASER持续优于现有SOTA基线;消融表明,sigmoid门控的STA优于标准softmax压缩,GSTA能在低成本下补足跨段信息。
研究意义
这项工作直接回应了工业推荐中的“Latency Wall”:一边是超长用户序列带来的I/O与存储压力,一边是标准自注意力的O(L²)计算瓶颈。LASER证明,超长序列并不一定只能靠“截断”或“两阶段检索”来处理,也可以在端到端框架内保留生命周期行为信号,并在真实线上环境中获得可观收益。
技术贡献
技术贡献有两层。系统层面,SeqVault把分散的short-term lastN、long-term lastN与多场景side info统一到同一服务,靠DRAM索引+SSD存储+序列级merge降低尾延迟和磁盘浪费。算法层面,STA用低维投影与sigmoid静默机制实现“压缩而不盲目分配注意力”,GSTA再以堆叠目标注意力恢复段间交互,形成“compress-then-refine”的高效长序列建模范式。
新颖性
新颖性不只在“更长”,而在“全栈闭环”。相较DIN、SIM等依赖短序列或两阶段筛选的方法,LASER把目标感知压缩、全局精炼与在线服务基础设施合并为一个可部署方案;相较常规softmax注意力,它显式允许无关段输出接近0,减少噪声放大。
局限性
- 论文主要基于小红书的工业场景与内部数据验证,公开部分未给出离线数据集名称、规模细节和完整超参数,因此外部复现与横向比较仍受限制。
- STA依赖固定窗口分段w与最近r段等设计,若用户兴趣切换极快或行为序列结构高度不均匀,固定分段可能并非最优。
- SeqVault与GSTA都面向高工程投入环境,迁移到资源受限平台时,混合存储、索引维护与分布式通信优化的收益未必同样显著。
未来方向
作者已指向多场景统一建模这一方向。后续可进一步研究自适应分段、动态窗口、跨模态行为统一压缩,以及在更多推荐、搜索和广告任务上的可迁移性与稳健性评估。
AI 总览摘要
LASER瞄准的是现代推荐系统里最棘手的现实问题:用户行为序列越来越长,但线上系统不能慢。传统短序列模型常把历史压缩到最近百余步,信息丢失明显;两阶段长序列方案则先筛再算,往往在检索阶段就把终身兴趣“筛没了”。在小红书这样拥有海量内容互动、搜索、购物行为的场景中,这种“Latency Wall”尤为突出,因为既要读到全量历史,又要在毫秒级完成排序。
为此,LASER把系统和模型一起重做。SeqVault负责序列服务:用DRAM做哈希索引、SSD做大容量存储,并以schema-aware方式统一多场景side info与用户历史,替代过去碎片化的RedLastN流程。模型侧则采用“compress-then-refine”:STA先在固定窗口内用目标相关的低维Q/K/V做压缩,sigmoid门控充当静默机制,把噪声行为尽量压到接近0;随后GSTA在压缩后的段级序列上堆叠建模跨段依赖,再把全局表示、max pool和最近r段特征送入RankMixer。
结果非常直接:SeqVault把检索延迟降50%、CPU降75%,训练资源消耗降低10倍;在线A/B测试覆盖超过1亿DAU,ADVV提升2.36%,收入提升2.08%。这说明LASER不是只在离线AUC上“好看”,而是真正把超长序列建模转化成了业务增长。更重要的是,它给工业界提供了一条可部署路径:不再在“保信息”和“保速度”之间二选一,而是通过端到端架构同时兼顾两者。
深度分析
研究背景
推荐系统从DIN、GRU4Rec一类短序列建模,逐步走向SIM、离线表征与长序列直接建模。问题在于,用户历史已不只是最近点击,而是跨搜索、内容、商品等多场景的生命周期轨迹;若只保留短窗,会丢失长期偏好与兴趣漂移。
核心问题
核心难点有两个:一是取数慢,长历史带来磁盘I/O、网络与序列拼接开销;二是算得慢,标准自注意力复杂度为O(L²)。两阶段检索虽能减长,但硬筛选或相似度召回会造成不可逆信息损失,难以精准服务目标item。
核心创新
LASER的创新是“服务+算法”双轮驱动。SeqVault统一承载多场景历史,并用混合DRAM-SSD索引解决访问瓶颈;STA用sigmoid而非softmax做段内目标感知聚合,允许无关行为“沉默”;GSTA再在压缩序列上做深层目标注意力,恢复跨段语义。三者组合成可在线部署的全栈方案。
方法详解
- �� 输入:从SeqVault取出用户序列H={h1...hL}、目标item t,以及ID、多模态embedding、相似度、recency等side info。
- �� 分段:用split_seq(H,w)把序列切成L'个不重叠窗口,每段w个token,先隔离噪声再做局部聚合。
- �� STA:Q=tWq,K=SiWk,V=SiWv,s_i=Sigmoid(QK^T/γ)V;用低维投影d_q≪d降低计算,并用sigmoid静默机制避免softmax强制分配权重。
- �� 段内增强:s_i经FFN与LN提升表达力,得到压缩段表示H'。
- �� GSTA:在H'上堆叠L_stack层,a_l=softmax((t_{l-1}W_q^l)(H'W_k^l)^T/√d),o_l=a_l(H'W_v^l),t_l=t_{l-1}+o_l。
- �� 融合:拼接z、max_pool(H')与最近r段,输入RankMixer,目标函数为式(2)的BCE。
实验设计
论文报告了两类评估。离线侧,LASER与现有长序列/短序列基线比较,指标以AUC等CTR指标为主,但公开节选未完整列出数据集名称。在线侧,在小红书主站广告排序场景进行A/B测试,覆盖超1亿DAU,并对业务指标ADVV与收入做端到端验证。同时还评估了SeqVault的检索延迟、CPU占用和训练资源消耗。
结果分析
最强结果来自线上:ADVV +2.36%、收入 +2.08%,说明模型优化最终转化为商业收益。基础设施上,SeqVault将检索延迟降50%、CPU降75%,并支持毫秒级访问全量历史。方法上,STA与GSTA的分工清晰:前者压缩去噪,后者补足全局依赖;消融显示这种分工优于单纯softmax或仅局部建模。
应用场景
最直接的应用是广告CTR排序、内容推荐和多场景统一用户建模。凡是需要读取全生命周期历史、又必须在线毫秒响应的系统,都可采用LASER式分层存储与压缩注意力。其前提是有稳定的行为日志、统一的特征schema与可承受的GPU/CPU混合部署环境。
局限与展望
局限主要在可迁移性与公开性。首先,实验数据主要来自小红书工业环境,外部数据集与完整配置未公开。其次,固定分段和窗口大小需要人工设定,对剧烈兴趣切换用户可能不够自适应。最后,系统收益依赖混合存储与服务改造,落地成本不低。
通俗解读 非专业人士也能看懂
把LASER想成一家超忙的大餐厅。顾客的点餐历史像一大叠账单,最早的、最近的、不同分店的都堆在一起。如果厨师每次都把所有账单从头翻到尾,肯定会慢;可如果只看最近几张,又会忘记老顾客长期爱吃什么。LASER先把账单分成一小叠一小叠,每叠里先把明显没用的信息轻轻“静音”,再把每叠提炼成一句话,最后再把这些一句话重新拼起来看全局。这样既不会被杂乱信息淹没,也不会丢掉重要线索。SeqVault就像一个又快又整齐的仓库,常用的单子放门口,老单子放大仓库里,所以找得快、占地方少。结果就是,餐厅出菜更快,还更懂老顾客口味。
简单解释 像给14岁少年讲一样
想象你在玩一个超大型游戏,系统要根据你从小到大的所有操作来猜你下一步想干嘛。要是只看最近10次操作,当然很快,但你以前练过什么职业、常用什么打法,全没了;要是把所有操作都硬塞进去,游戏又会卡爆。LASER的聪明之处,就是先把一长串操作分成很多小段,每段先判断“这段是不是跟当前目标有关”,没关系的就尽量忽略,有关系的才保留。然后它再把这些小段重新串起来,看看它们之间有没有隐藏联系。
更酷的是,LASER不只是模型厉害,连“翻历史记录”的仓库也一起升级了。SeqVault像一个超级整理柜:常用资料放前面,冷门资料放后面,但你都能很快找到。这样系统就不会因为找记录而拖慢。换句话说,它不是单纯让AI更聪明,而是让整个流程都更顺。
你可以把它理解成:先用放大镜找重点,再用拼图把重点拼成完整故事。这样一来,既不会错过你长期的“老习惯”,也不会被一堆没用的小动作干扰。对推荐系统来说,这真的很重要,因为它要猜的不是“你刚刚看了什么”,而是“你到底是谁、你真正喜欢什么”。
所以LASER为什么厉害?因为它同时解决了“看得全”和“跑得快”这两个矛盾。以前很多方法只能二选一:要么快但粗糙,要么准但太慢。LASER告诉我们,分段、静音、再精炼,可以两者兼得。
术语表
SeqVault(统一长序列服务)
这是LASER的序列存取基础设施,用来统一管理用户全生命周期行为和side info。技术上,它用DRAM-SSD混合索引和schema-aware存储降低检索延迟与磁盘浪费。
用于替代过去碎片化的RedLastN流程,并支撑实时训练与推理一致性。
STA / Segmented Target Attention(分段目标注意力)
它先把长序列切成固定窗口,再在每段内围绕目标item做注意力压缩。与softmax不同,它用sigmoid门控,可让无关行为接近“静音”。
用于式(5),完成段内压缩并生成段级表示s_i。
GSTA / Global Stacked Target Attention(全局堆叠目标注意力)
这是压缩后的二级建模模块,在段级序列上叠加多层目标注意力,恢复跨段依赖。它保留了全局交互能力,但计算成本远低于原始长序列自注意力。
用于式(7),输出最终全局向量z。
Silence mechanism(静默机制)
指sigmoid门控允许不相关token的权重自然趋近0,而不是像softmax那样必须分到概率质量。直观上,它像“允许模型装作没看见噪声”。
是STA抑制噪声、避免错误放大的关键设计。
RankMixer(特征交互层)
这是LASER后续的特征融合与排序模块,把序列表示和其他特征一起做高阶交互。它相当于最终的“裁判”,决定这些历史信号如何影响CTR预测。
LASER的z、max_pool(H')和最近r段特征都会送入RankMixer。
开放问题 这项研究留下的未解疑问
- 1 公开文本未给出离线数据集名称、样本规模与完整超参数,难以判断LASER在公开基准上的可复现性与泛化边界。
- 2 固定窗口分段w与最近r段的选择是否对所有用户都最优尚不明确;自适应分段或许能进一步提升对突发兴趣变化的响应。
- 3 SeqVault带来的系统收益很强,但在中小规模或低算力环境下,混合存储与索引维护的性价比仍需单独验证。
应用场景
近期应用
广告CTR排序
适合需要读取全量历史、又必须毫秒级响应的广告排序系统。可直接把LASER接到现有特征交互层前端,提升对长期偏好与短期意图的联合建模能力。
内容/电商推荐
适合内容社区、电商和搜索推荐中的多场景用户建模。前提是统一日志schema,并能部署SeqVault式存储与STA/GSTA式序列编码。
远期愿景
多场景统一兴趣底座
长期上,LASER可演化为跨内容、广告、搜索、交易的统一兴趣表示层,逐步替代多个割裂的历史服务,形成更通用的终身用户理解框架。
原文摘要
Modeling ultra-long user behavior sequences is pivotal for capturing evolving and lifelong interests in modern recommendation systems. However, deploying such models in real-time industrial environments faces a strict "Latency Wall", constrained by two distinct bottlenecks: the high I/O latency of retrieving massive user histories and the quadratic computational complexity of standard attention mechanisms. To break these bottlenecks, we present LASER, a full-stack optimization framework developed and deployed at Xiaohongshu (RedNote). Our approach tackles the challenges through two complementary innovations: (1) System efficiency: We introduce SeqVault, a unified schema-aware serving infrastructure for long user histories. By implementing a hybrid DRAM-SSD indexing strategy, SeqVault reduces retrieval latency by 50% and CPU usage by 75%, ensuring millisecond-level access to full real-time and life-cycle user histories. (2) Algorithmic efficiency: We propose a Segmented Target Attention (STA) mechanism to address the computational overhead. Motivated by the inherent sparsity of user interests, STA employs a sigmoid-based gating strategy that acts as a silence mechanism to filter out noisy items. Subsequently, a lightweight Global Stacked Target Attention (GSTA) module refines these compressed segments to capture cross-segment dependencies without incurring high computational costs. This design performs effective sequence compression, reducing the complexity of long-sequence modeling while preserving critical signals. Extensive offline evaluations demonstrate that LASER consistently outperforms state-of-the-art baselines. In large-scale online A/B testing serving over 100 million daily active users, LASER achieved a 2.36% lift in ADVV and a 2.08% lift in revenue, demonstrating its scalability and significant commercial impact.