核心发现
方法论
论文将用户一小时会话中的连续商品构造成加权有向图,以DeepWalk随机游走和Skip-Gram学习商品表示。BGE仅使用行为图;GES用平均池化融合商品、类目、品牌等侧信息;EGES进一步以可学习权重进行加权聚合,并通过负采样优化二分类目标。
关键结果
- 在Amazon数据集上,BGE、GES、EGES的AUC分别为0.9327、0.9575和0.9700;EGES较BGE提升4.00%,说明侧信息及其加权机制能显著改善链接预测。
- 在Taobao数据集上,BGE为0.8797,GES为0.9704,EGES为0.9746,EGES较BGE提升10.8%;其表现超过LINE(1st)的0.9100和LINE(2nd)的0.9411。
- 2017年11月连续七天在线A/B测试显示,GES与EGES的首页CTR稳定超过Base商品协同过滤和BGE;EGES始终优于GES,验证了加权侧信息聚合的生产价值。
研究意义
研究把图表示学习从中小规模网络推进到阿里商品级生产环境,直接回应十亿用户、二十亿商品、极端稀疏和持续上新的现实约束。它说明匹配阶段不必为每个商品训练复杂用户模型,也能通过向量相似度快速召回候选,为后续深度排序提供更高质量输入。
技术贡献
贡献包括会话级有向商品图构造、基于DeepWalk的BGE、平均聚合的GES和可学习指数权重聚合的EGES。EGES以H_v=Σe^{a_v^j}W_v^j/Σe^{a_v^j}形成商品表示,并结合负采样Skip-Gram更新商品、侧信息和权重,从而同时支持高阶行为相似性与冷启动泛化。
新颖性
相较只依赖共现的传统商品CF,以及只建模图邻接关系的LINE,论文把异质侧信息直接置于图嵌入训练路径中。核心新意不是单纯增加特征,而是让不同侧信息学习不同贡献,形成适用于超大规模匹配系统的EGES框架。
局限性
- 论文主要报告链接预测AUC和CTR,缺少长期GMV、转化率、用户留存及公平性分析;CTR提升不能完全代表商业收益。
- 随机游走和负采样仍需处理数十亿规模节点,且侧信息质量、时间窗口和权重稳定性可能影响结果。
未来方向
后续可研究时间感知图、用户与商品联合嵌入、在线增量更新及更强的多模态侧信息。还应评估曝光偏差、流行度放大、隐私保护和跨场景迁移,并将召回目标从点击扩展到购买、长期价值与多样性。
AI 总览摘要
淘宝拥有约十亿用户和二十亿商品,传统协同过滤在如此稀疏、动态的环境中难以兼顾规模、精度与新商品冷启动。论文聚焦推荐两阶段中的匹配环节:先为用户历史商品召回相似候选,再交给深度神经网络排序。作者指出,单纯商品共现既忽略行为顺序,也无法处理没有交互记录的新商品。
研究将一小时内连续行为构造成加权有向商品图,边权表示商品转移频次。BGE使用DeepWalk随机游走生成序列,再用Skip-Gram和负采样学习商品向量;GES把商品与类目、品牌、价格等侧信息平均融合;EGES则学习不同侧信息的指数权重。这样,商品不仅依据真实行为接近,也能借助共享属性获得合理表示。
实验覆盖Amazon Electronics和Mobile Taobao。160维嵌入、随机游走长度10、每节点20次游走、窗口5时,EGES在Amazon和Taobao上的AUC分别为0.9700和0.9746,较BGE提升4.00%和10.8%。七天线上A/B测试中,EGES持续优于传统Base协同过滤、BGE和GES。系统依托XTensorflow处理大规模训练,展示了图嵌入从研究算法走向实时电商生产的可行路径,但长期商业指标、偏差治理和动态更新仍待深入研究。
深度分析
研究背景
淘宝在2017年拥有约十亿用户、二十亿商品,首页推荐贡献移动端约40%的推荐流量。传统CF、内容方法和深度模型在百万级数据上有效,但在超大规模、极端稀疏和每小时大量上新的商品环境中面临瓶颈。论文借鉴DeepWalk、LINE和word2vec,将图表示学习用于工业级商品匹配。
核心问题
目标是计算商品间相似度并生成候选集,而非直接完成最终排序。挑战包括节点和边规模巨大、用户兴趣随时间变化、行为共现稀疏,以及新商品没有历史交互。仅使用长期历史会增加成本并混淆兴趣漂移,仅使用CF又难以捕获多跳关系和顺序信息。
核心创新
第一,使用一小时会话中的连续行为构造加权有向图,保留转移方向。第二,BGE通过随机游走捕获高阶相似性。第三,GES平均聚合商品和侧信息,改善稀疏与冷启动。第四,EGES用可学习权重区别品牌、类目、商店等信号的重要性,并部署到XTensorflow生产平台。
方法详解
- �� 数据清洗:移除停留少于1秒的点击、疑似刷子用户行为,以及长期更新后语义改变的商品标识。
- �� 建图:在一小时会话内连接连续商品,边权为全体用户的转移频次;随机游走转移概率为P(v_j|v_i)=M_ij/Σ_jM_ij。
- �� BGE:以DeepWalk产生长度10、每节点20条序列,用窗口5的Skip-Gram和负采样学习160维向量。
- �� GES:将商品及n类侧信息向量平均为H_v=(1/(n+1))ΣW_v^s。
- �� EGES:以H_v=Σe^{a_v^s}W_v^s/Σe^{a_v^s}加权融合,并用逻辑损失与梯度更新。
实验设计
链接预测随机移除1/3边,等量采样无边节点对,以AUC评价。Amazon含300,150节点、3,740,196条边和3类侧信息;Taobao含2,632,379节点、44,997,887条边和12类侧信息,稀疏度分别为99.58%和99.943%。比较BGE、LINE(1st)、LINE(2nd)、GES和EGES。线上测试比较Base商品CF与四种嵌入方法。
结果分析
Amazon上LINE(1st)、BGE、GES、EGES分别为0.9554、0.9327、0.9575、0.9700;Taobao上分别为0.9100、0.8797、0.9704、0.9746。GES和EGES在两数据集均超过BGE与LINE。Taobao提升更大,可能源于12类有效侧信息;在线七天CTR排序稳定为EGES优于GES,且二者优于BGE和Base。
应用场景
适用于首页“猜你喜欢”、相似商品、广告候选召回和新商品冷启动。工程前提是拥有可靠的会话日志、商品属性及离线图训练基础设施;线上仅需存储向量和近邻结果,再交由排序模型处理,可降低匹配延迟并扩展到大规模目录。
局限与展望
方法依赖一小时窗口、连续行为质量和静态侧信息,无法充分表达季节性、实时兴趣和多模态内容。随机游走、负采样及全量向量更新仍有显著计算成本;论文未给出训练时延、资源消耗、显著性检验及详细CTR数值,也未系统分析流行度偏差、同质化和长期用户价值。
通俗解读 非专业人士也能看懂
把淘宝想成一座每天不断进货的巨大商场。顾客在一个小时内连续逛过的货架,就像一条“购物路线”:有人先看手机再看耳机,系统便在两件商品之间画一条带方向的路,走得越多,路越粗。
第一种方法像只看地图上的路线,利用随机漫游发现“隔着几站也常被一起走到”的商品。第二种方法还看商品标签,例如品牌、类别和商店;即使一件新商品没人看过,只要它和旧商品拥有相似标签,也能被放到合理位置。第三种方法更聪明:它不会假定所有标签同样重要,而会自己学习品牌、类别或价格哪个更能解释顾客下一步会看什么。
最后,系统把相似商品送给另一个排序员,排序员再结合具体顾客决定展示顺序。实验表明,这种“路线加标签”的地图在淘宝数据上AUC达到0.9746,比只看路线的BGE高10.8%,线上点击率也连续七天更好。它像是给商场装上了会学习的导航系统,但仍可能受到错误标签、过度推荐热门商品和顾客兴趣变化的影响。
简单解释 像给14岁少年讲一样
想象你在一个超大的游戏商城里找装备。商城里有二十亿件商品,玩家每天只看很少一部分,所以系统不能把每件装备和每个人都逐一比较,那会慢到爆!
论文的方法先观察玩家的连续动作:如果很多人看完A又看B,就在A和B之间画一条路。系统让一个小机器人沿着这些路随机走,走过很多次后,就能发现“虽然不直接相连,但玩家常常绕一圈看到”的商品。这个方法叫DeepWalk,得到的是每件商品的一串数字坐标。
可是新装备刚上架,没人看过怎么办?系统再看它的标签,比如类别、品牌、商店和价格。相同标签的装备可以先靠近。GES把这些信息平均混合,EGES则自己判断哪个标签更重要:买了苹果手机的人可能更容易看苹果电脑,但在服装店里,店铺标签未必比款式更重要。
结果很厉害:在Taobao测试中,EGES得分0.9746,而基础方法BGE只有0.8797;线上七天点击率也持续领先。简单说,它先用大家的浏览路线找相似商品,再用商品标签帮助新商品“融入地图”。不过,系统仍需要干净的数据,还要防止大家只看到热门商品。以后如果它能实时理解兴趣变化,推荐会更聪明!
术语表
Graph Embedding(图嵌入)
把图中的节点转换为低维数字向量,使结构相近的节点在向量空间中更接近。它把复杂关系转化为可计算的相似度。
论文用它表示Taobao商品,并通过向量点积计算候选商品相似性。
DeepWalk(深度游走)
在图上进行随机游走生成节点序列,再用Skip-Gram学习节点表示。它能够捕获多跳拓扑关系。
BGE、GES和EGES都以DeepWalk生成训练序列。
Skip-Gram(跳字模型)
根据中心元素预测上下文元素的表示学习方法。论文用负采样近似其概率优化目标。
它从随机游走序列中学习商品及上下文商品向量。
Side Information(侧信息)
商品行为之外的属性,如品牌、类目、商店、价格和用户画像标签。它可为稀疏或无行为商品提供额外信号。
GES平均融合侧信息,EGES学习其不同权重。
Cold Start(冷启动)
新商品或新用户缺乏历史交互,导致系统难以估计其兴趣关系。电商中持续上新的商品使问题尤其严重。
论文利用侧信息改善无交互商品的表示。
开放问题 这项研究留下的未解疑问
- 1 论文没有公开完整训练资源、延迟和成本,也未说明在二十亿商品全量更新时如何保持实时性;未来需要可复现的系统基准。
- 2 CTR提升是否转化为购买、GMV和长期留存尚不清楚;还需研究曝光偏差、热门商品放大及推荐多样性的因果评估。
应用场景
近期应用
首页相似商品召回
电商平台可用会话行为建立商品图,训练EGES向量并为用户历史商品召回近邻候选,再交给现有排序模型。需要稳定日志、商品属性和向量检索服务,可直接改善匹配质量。
新商品冷启动
上架商品即使没有点击,也能依据品牌、类目、店铺和价格获得初始表示。平台可将其加入相似商品、广告或活动候选,减少等待行为数据积累的时间。
远期愿景
实时、多目标推荐平台
未来可把时间衰减、图像文本、多目标价值和用户长期反馈加入统一嵌入系统,使平台同时优化点击、购买、留存、多样性与公平性。
原文摘要
Recommender systems (RSs) have been the most important technology for increasing the business in Taobao, the largest online consumer-to-consumer (C2C) platform in China. The billion-scale data in Taobao creates three major challenges to Taobao's RS: scalability, sparsity and cold start. In this paper, we present our technical solutions to address these three challenges. The methods are based on the graph embedding framework. We first construct an item graph from users' behavior history. Each item is then represented as a vector using graph embedding. The item embeddings are employed to compute pairwise similarities between all items, which are then used in the recommendation process. To alleviate the sparsity and cold start problems, side information is incorporated into the embedding framework. We propose two aggregation methods to integrate the embeddings of items and the corresponding side information. Experimental results from offline experiments show that methods incorporating side information are superior to those that do not. Further, we describe the platform upon which the embedding methods are deployed and the workflow to process the billion-scale data in Taobao. Using online A/B test, we show that the online Click-Through-Rate (CTRs) are improved comparing to the previous recommendation methods widely used in Taobao, further demonstrating the effectiveness and feasibility of our proposed methods in Taobao's live production environment.