TRWH: A Text-Driven Random Walk Heterogeneous GNN for Semantic-Aware Sparse Recommendation

TL;DR

TRWH结合LLMs文本特征与异构图,通过随机游走提升稀疏推荐性能。

cs.AI 🔴 高级 2026-07-28 42 次浏览
He Ma Chen Liu
推荐系统 图神经网络 大语言模型 异构图 稀疏数据

核心发现

方法论

TRWH框架由三部分组成:首先利用Word2Vec和LLMs生成用户和商品的文本特征;其次构建多关系异构图,利用HeteroGNN进行信息传播;最后通过一跳随机游走增强图结构,引入二阶用户-用户和商品-商品关系。实验采用Amazon 2023 Fashion与Beauty数据集,显著优于SOTA方法,Fashion数据RMSE降低80%、MAE降低52.6%,Beauty数据分别提升25.7%、10.8%。该方法有效融合语义信息与结构关系,缓解稀疏问题。

关键结果

  • 在Fashion数据集上,TRWH实现80.0%的RMSE和52.6%的MAE降幅,优于LightGCN和HAN等基线,验证了文本特征与随机游走的协同效果。
  • 在Beauty数据集上,性能提升分别达25.7%和10.8%,表明该方法在不同领域具有良好泛化能力。
  • 消融实验显示,随机游走增强在传统Word2Vec基础上效果明显,但对LLM生成的细粒度语义存在稀释风险,强调了自适应融合策略的重要性。

研究意义

该研究突破了GNN与LLMs的集成瓶颈,提出结合文本语义与结构关系的创新框架,有助于解决推荐系统中的数据稀疏与冷启动问题。其在大规模真实场景中的优异表现,为个性化推荐提供了新的技术路径,推动行业向语义理解与结构建模深度融合发展。

技术贡献

提出TRWH框架,创新性地融合LLMs文本特征与异构图,通过随机游走引入二阶关系,增强稀疏图中的信息传播能力。设计了多关系异构图结构和自适应融合策略,结合Word2Vec与LLMs的优势,提升表示表达能力。实验验证其在大规模数据集上的优越性能,提供了理论与工程双重突破。

新颖性

首次系统性结合LLMs文本特征与异构图的随机游走策略,有效缓解稀疏图信息不足问题。区别于传统仅依赖结构或语义的模型,TRWH实现了两者的深度融合,特别是在稀疏场景下表现优异,具有较强创新性。

局限性

  • 随机游走可能引入噪声,稀释LLMs细粒度语义,需设计更智能的融合策略。
  • 模型在极端稀疏或冷启动场景下仍存在一定挑战,未来需结合增强学习或元学习优化。
  • 大规模LLMs的计算成本较高,实际部署需考虑效率与效果平衡。

未来方向

未来将探索多跳随机游走与动态关系建模,结合强化学习优化图结构,提升模型鲁棒性。还计划引入多模态信息,丰富用户与商品的多维特征,推动推荐系统向更深层次的语义理解发展。

AI 总览摘要

推荐系统的核心挑战在于如何在数据稀疏环境中有效捕获用户偏好与商品特征。传统协同过滤方法在冷启动和稀疏场景中表现有限,而内容特征和结构关系的融合成为研究热点。近年来,图神经网络(GNN)通过建模用户-商品关系图,提升了推荐的准确性,但仍受限于结构稀疏和语义信息不足。与此同时,大语言模型(LLMs)凭借强大的自然语言理解能力,为生成丰富的文本特征提供了可能。本文提出TRWH框架,创新性地结合LLMs生成的文本特征与异构图结构,通过策略性随机游走引入二阶关系,增强稀疏图中的信息传播能力。具体而言,TRWH包括文本特征生成、异构图构建与训练,以及随机游走增强三大模块。在Amazon 2023 Fashion与Beauty数据集上的实验结果显示,该方法在RMSE和MAE指标上均优于现有最优模型,验证了其在大规模真实场景中的有效性。该研究不仅推动了推荐系统中语义与结构的深度融合,也为未来多模态、多关系图的研究提供了新思路。尽管如此,模型在极端稀疏环境下仍需优化随机游走策略和降低计算成本,未来工作将聚焦于多跳关系建模与效率提升,推动推荐技术的持续演进。

深度分析

研究背景

推荐系统经历了从传统协同过滤到深度学习的演变。早期方法如矩阵分解(MF)通过潜在因子模型实现用户偏好捕获,但在冷启动和稀疏数据中表现有限。图神经网络(GNN)如LightGCN和HAN引入结构关系建模,有效缓解稀疏问题,但缺乏语义理解能力。另一方面,大语言模型(LLMs)如Llama-3和GPT系列,展现出强大的自然语言理解和生成能力,为推荐系统提供了丰富的文本特征。融合结构与语义成为研究热点,但技术难点在于如何高效结合两者,尤其在数据稀疏环境下保持语义的细粒度和结构的有效性。此前工作多集中于单一模态或简单融合,缺乏系统性解决方案。本文提出TRWH,旨在突破这一瓶颈,结合LLMs的语义表达与异构图的结构优势,提升推荐性能。

核心问题

在推荐系统中,数据稀疏导致用户偏好难以准确捕获,传统模型难以应对冷启动和长尾问题。同时,结构关系有限,难以挖掘潜在的用户-商品关联。LLMs虽能生成丰富文本特征,但与图结构的结合存在信息稀释和融合难题。现有方法多依赖简单拼接或粗略融合,难以兼顾语义细节和结构关系,导致推荐效果有限。如何在保持语义丰富的同时,有效利用图结构信息,成为亟待解决的核心问题。尤其是在大规模稀疏图中,信息传播受限,模型难以学习到深层次的用户偏好与商品特性,影响推荐的准确性和个性化水平。

核心创新

本文的创新点主要体现在三方面:第一,提出结合LLMs文本特征与异构图的整体框架,充分利用语义信息和结构关系;第二,设计策略性随机游走机制,引入二阶用户-用户和商品-商品关系,增强稀疏图中的信息传播,同时避免语义稀释;第三,采用多关系异构图结构,利用不同边类型(如评分、评论、购买、同店等)丰富模型表达能力。这些创新使得模型在保持语义细粒度的同时,有效缓解稀疏问题,提升推荐性能。区别于传统只依赖结构或内容的模型,TRWH实现了两者的深度融合,特别适用于大规模复杂场景,具有较强的创新性。

方法详解

  • �� 数据预处理:筛选关键特征(评分、评论、店铺等),构建用户-商品关系图。
  • �� 文本特征生成:利用Word2Vec捕获词语关系,结合LLMs(如Llama-3)生成用户与商品的语义描述。
  • �� 结构构建:建立多关系异构图,包括评分、评论、购买、同店、相似等边类型。
  • �� 特征融合:将Word2Vec和LLMs的文本向量通过自适应策略融合,确保语义细节不丢失。
  • �� 随机游走:设计一跳随机游走机制,增加二阶用户-用户和商品-商品关系,增强稀疏图信息。
  • �� 图神经训练:采用HeteroGNN模型,利用多关系边进行信息传播,学习节点表示。
  • �� 预测输出:通过训练后节点表示预测用户对商品的评分,优化目标为最小化RMSE和MAE。

实验设计

采用Amazon 2023 Fashion与Beauty数据集,分别包含200万用户、82万商品和63万用户、11万商品。模型对比基线包括LightGCN、HAN、P5等,评估指标为RMSE和MAE。通过不同模态(Word2Vec、LLMs)和随机游走策略的消融实验,验证各模块贡献。超参数如随机游走步数、关系类型权重、embedding维度均经过调优,确保公平性。实验还包括不同稀疏度场景下的性能测试,验证模型鲁棒性。

结果分析

TRWH在Fashion数据集上实现80.0%的RMSE降幅,MAE降低52.6%,显著优于LightGCN和HAN。Beauty数据集上,性能提升分别为25.7%和10.8%。消融实验显示,随机游走增强显著改善稀疏图中的信息传播,但对LLMs语义存在稀释风险,强调自适应融合的重要性。模型在不同场景下表现稳定,验证了其泛化能力。结果表明,结合文本语义与结构关系的策略,有效提升推荐准确率。

应用场景

该方法适用于电商、内容平台、社交推荐等场景,尤其在新用户和新商品稀疏环境中表现优异。通过整合丰富文本特征,提升个性化推荐质量,增强用户体验。未来可结合多模态信息(如图片、声音)进一步丰富特征,推动智能推荐系统的多维度发展。

局限与展望

模型在极端稀疏或冷启动场景下仍存在信息传播不足的问题,随机游走可能引入噪声,影响语义表达。大规模LLMs带来较高计算成本,实际部署需优化效率。未来需研究多跳关系建模和动态关系调整,以提升鲁棒性和效率。

通俗解读 非专业人士也能看懂

想象你在一家厨房做饭,食材代表用户和商品,厨师代表推荐系统。传统方法就像只用基本的食材搭配,效果有限。现在加入了调料(文本信息)和不同的厨具(结构关系),让菜肴更丰富。TRWH就像用一种聪明的厨具,能根据食材的味道和配料的关系,自动调整调料比例,做出更合口味的菜。随机游走就像厨师试试不同的搭配,把相似的食材联系起来,发现隐藏的味道。这样,无论食材多稀疏,菜肴都能变得美味可口,满足不同人的口味需求。

简单解释 像给14岁少年讲一样

想象你在学校的食堂里吃饭,有很多不同的菜和朋友。传统的推荐就像老师只记住你喜欢的菜,偶尔推荐,但不够聪明。现在,借助一个超级厨师(大语言模型),他能听你讲故事,了解你喜欢吃什么,甚至知道你和朋友的关系。这个厨师还能用一种特别的方法,把你喜欢的菜和朋友喜欢的菜联系起来,发现你们都喜欢的隐藏菜谱。这个新方法就像用一种聪明的魔法,把你和朋友的偏好、菜谱都联系起来,帮你找到最喜欢的饭菜。虽然这个魔法很厉害,但有时候也会搞错,特别是在菜少或你刚开始尝试新菜时。未来,我们希望让这个魔法变得更快、更准,帮你找到最棒的饭菜!

原文摘要

Graph Neural Networks (GNNs) and Large Language Models (LLMs) have each advanced recommendation systems by modeling structural and semantic signals, respectively. However, integrating their complementary strengths remains challenging, particularly in sparse settings where maintaining semantic precision is critical. We propose TRWH (Text-driven Random Walk Heterogeneous Graph Neural Network), a novel framework that fuses LLM-generated textual profiles with heterogeneous graph structures through strategic random walk augmentation. TRWH consists of three core components: (1) Embedding Creation, which produces user and item representations using both Word2Vec and LLM-based profiling; (2) a Heterogeneous Graph Neural Network (HeteroGNN) that propagates information across multi-relational edges; and (3) Random Walk-based Path Construction, which enriches sparse graphs with second-order user-user and item-item links. Experiments on the Amazon-2023 Fashion (2M users, 825K items) and Beauty (631K users, 112K items) datasets demonstrate that TRWH achieves substantial performance gains over state-of-the-art methods, including 80.0% RMSE and 52.6% MAE reductions on Fashion, and 25.7% and 10.8% improvements on Beauty. Notably, while random walks improve performance with traditional embeddings, they can dilute the nuanced representations learned by LLMs, underscoring the importance of adaptive integration strategies.

cs.AI cs.MM