Beyond Modality Harmony: Orthogonal Purification and Topology-Guided MoE for Conflict-Aware Multimodal Recommendation

TL;DR

OrthoRec通过正交净化和拓扑引导的专家混合模型提升多模态推荐性能,在亚马逊数据集上表现优异。

cs.IR 🔴 高级 2026-09-02 1 次浏览
Jialin Liu Zhaorui Zhang Ray C. C. Cheung
多模态推荐 图神经网络 正交净化 专家混合模型 对比学习

核心发现

方法论

OrthoRec提出了正交净化和拓扑引导的专家混合模型。正交净化通过几何分解将多模态特征分为与协作锚点平行和正交的方向。拓扑引导的专家混合模型使用解耦的Sigmoid门控来突破传统Softmax注意力的零和瓶颈,自主决定每个净化模态的注入规模。

关键结果

  • 在三个真实的亚马逊数据集上,OrthoRec比最近的基线方法提高了约15%的推荐准确率,并在模态噪声和物品稀疏情况下表现出更强的鲁棒性。
  • 与传统的多模态融合方法相比,OrthoRec在处理视觉诱饵和语义不匹配时表现出色。
  • 消融实验显示,正交净化模块对提升模型性能贡献最大。

研究意义

该研究挑战了“模态和谐”假设,提出了新的方法来解决多模态推荐中的模态拓扑冲突问题。它不仅提高了推荐系统的准确性,还增强了系统在面对噪声和稀疏数据时的鲁棒性。

技术贡献

OrthoRec通过几何分解和拓扑引导的专家混合模型提供了新的理论保证和工程可能性。与现有方法相比,它能够更有效地处理多模态噪声,并提供更稳定的推荐结果。

新颖性

OrthoRec首次提出了正交净化和拓扑引导的专家混合模型,突破了传统多模态推荐中的零和融合瓶颈,提供了更灵活的模态处理机制。

局限性

  • 在处理极端稀疏数据时,模型性能仍有下降。
  • 需要额外的计算资源来进行正交净化和专家混合。
  • 模型在某些情况下对模态噪声的敏感性仍需优化。

未来方向

未来工作可以探索如何进一步优化正交净化过程,并研究在不同数据集上的泛化能力。此外,可以考虑将该方法应用于其他领域的多模态数据处理。

AI 总览摘要

多模态推荐系统通常假设模态特征是有益且与用户协作模式严格对齐的。然而,现实中视觉诱饵和语义不匹配导致模态拓扑冲突,污染了协作空间。OrthoRec通过正交净化和拓扑引导的专家混合模型解决这一问题。正交净化几何分解模态特征,拓扑引导的专家混合模型使用解耦的Sigmoid门控来突破传统Softmax注意力的零和瓶颈。实验表明,OrthoRec在亚马逊数据集上表现优异,显著提高了推荐准确率,并增强了系统在噪声和稀疏数据下的鲁棒性。尽管如此,模型在极端稀疏数据下的性能下降以及计算资源需求仍是挑战。未来工作将探索进一步优化正交净化过程,并研究在不同数据集上的泛化能力。

深度分析

研究背景

多模态推荐系统通过整合视觉和文本模态来解决传统协作过滤中的数据稀疏和冷启动问题。现有方法如LATTICE和MMGCN采用图消息传递和对比学习来构建用户和物品的潜在表示。然而,这些方法依赖于“模态和谐”假设,忽视了模态拓扑冲突带来的干扰。

核心问题

多模态推荐系统面临模态拓扑冲突问题,导致协作空间污染和表示扭曲。视觉诱饵和语义不匹配是主要原因,现有方法无法有效解决这一问题,影响推荐准确性。

核心创新

OrthoRec通过正交净化和拓扑引导的专家混合模型解决模态拓扑冲突。正交净化几何分解模态特征,保留安全的共识语义。专家混合模型使用解耦的Sigmoid门控来突破零和瓶颈,实现灵活的模态处理。

方法详解

  • �� 正交净化:将模态特征分解为与协作锚点平行和正交的方向。
  • �� 拓扑引导的专家混合模型:使用解耦的Sigmoid门控自主决定净化模态的注入规模。
  • �� 安全对比学习:动态惩罚矛盾模态对的强制对齐。

实验设计

实验在三个亚马逊数据集上进行,使用BEiT和RoBERTa提取视觉和文本特征。基线包括LATTICE和MMGCN。评估指标为推荐准确率和鲁棒性。消融实验验证了各模块的贡献。

结果分析

OrthoRec在推荐准确率上比基线方法提高约15%,在噪声和稀疏数据下表现出更强的鲁棒性。正交净化模块对性能提升贡献最大。

应用场景

OrthoRec可用于电商平台的个性化推荐,提升用户体验。它需要预训练的视觉和文本特征,适合处理多模态数据。

局限与展望

模型在极端稀疏数据下性能下降,计算资源需求较高。未来工作需优化正交净化过程,提高泛化能力。

通俗解读 非专业人士也能看懂

想象一个厨房,厨师需要从各种食材中挑选出最合适的来制作美味的菜肴。多模态推荐系统就像这个厨师,它需要从视觉和文本信息中选择最有用的部分来推荐给用户。OrthoRec就像一个聪明的助手,它帮助厨师过滤掉那些不合适的食材,比如过期的或者不匹配的食材,然后根据用户的口味来决定使用多少食材。这样,厨师就能做出更符合用户口味的菜肴。

简单解释 像给14岁少年讲一样

嘿,想象一下你在玩一个游戏,你需要选择不同的角色来组成一个团队。每个角色都有自己的优点和缺点。多模态推荐系统就像这个游戏,它需要从不同的信息中挑选出最好的组合来推荐给你。OrthoRec就像一个超级助手,它帮助你过滤掉那些不太好的角色,然后根据你的游戏风格来决定使用多少角色。这样,你的团队就会更强大,更符合你的游戏风格!

术语表

正交净化 (Orthogonal Purification)

一种几何分解方法,将模态特征分为与协作锚点平行和正交的方向。

用于过滤多模态推荐中的噪声。

专家混合模型 (Mixture-of-Experts)

一种模型架构,通过多个专家模块来处理不同的任务。

用于灵活处理多模态特征。

拓扑引导 (Topology-Guided)

使用协作拓扑信息来引导模型决策。

用于专家混合模型中的门控机制。

对比学习 (Contrastive Learning)

一种机器学习方法,通过最大化不同视图之间的互信息来提高模型性能。

用于增强多模态推荐系统的鲁棒性。

模态和谐 (Modality Harmony)

假设多模态特征是有益且一致的。

被挑战的假设,导致推荐系统的性能问题。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端稀疏数据下保持模型性能?现有方法在处理稀疏数据时表现不佳,需要新的解决方案。
  • 2 如何进一步优化正交净化过程?当前方法在某些情况下对模态噪声的敏感性仍需改善。

应用场景

近期应用

电商推荐

OrthoRec可以帮助电商平台提高推荐准确性,提升用户体验。需要预训练的视觉和文本特征。

远期愿景

跨领域多模态数据处理

OrthoRec可以扩展到其他领域,如医疗或社交媒体,处理复杂的多模态数据。需要进一步优化和验证。

原文摘要

Multimodal Recommender Systems (MRSs) typically rely on a flawed "modality harmony" assumption, presuming that multimodal features are inherently beneficial and strictly aligned with users' collaborative interaction patterns. However, modality-topology conflicts are ubiquitous in real-world scenarios due to deceptive visual clickbaits and mismatched semantics. Blindly integrating these noisy modalities inevitably pollutes the pristine collaborative space, causing severe representation distortion. To address this, we propose Orthogonal purification and topology-guided MoE for conflict-aware multimodal Recommendation (OrthoRec). At its core, OrthoRec introduces Collaborative-Guided Orthogonal Purification (CGOP), which geometrically decouples multimodal features into directions parallel and orthogonal to a pure collaborative anchor. By adaptively truncating the orthogonal noise with an energy-preserving normalization, CGOP rectifies deceptive semantic directions while preserving the modality's intrinsic representation capacity. Furthermore, we design a Topology-Aware Routing Mixture-of-Experts (TAR-MoE). Guided by the collaborative topology, TAR-MoE employs decoupled sigmoid gating to break the zero-sum bottleneck of traditional softmax attention, autonomously determining the injection scale for each purified modality. Finally, a safe-SSL objective is introduced to dynamically penalize the forced contrastive alignment of contradictory pairs. Experiments on three real-world Amazon datasets show that OrthoRec consistently outperforms competitive recent baselines and exhibits improved robustness under modality noise and item sparsity.

cs.IR cs.AI