TimeMM: Time-as-Operator Spectral Filtering for Dynamic Multimodal Recommendation

TL;DR

TimeMM通过时间调节的谱滤波实现动态多模态推荐,有效捕捉用户偏好演变。

cs.IR 🔴 高级 2026-04-29 44 次浏览
Wei Yang Rui Zhong Zihan Lin Xiaodan Wang Cheng Chen Huan Ren Yao Hu
多模态推荐 时间建模 谱滤波 图学习 非平稳动态

核心发现

方法论

TimeMM引入Time-as-Operator,将交互时间转化为参数化时间核,构建多尺度谱滤波器组。结合自适应谱滤波,根据时间上下文动态混合滤波器,捕获偏好变化。利用谱感知模态路由调节视觉与文本贡献,最后通过频谱多样性正则化保证专家多样性。核心算法包括时间核映射、谱滤波器混合和模态调度,避免显式特征分解,提升效率。

关键结果

  • 在多个真实数据集上,TimeMM在准确率和召回率方面均优于SOTA方法,提升幅度达3-5%。在Movielens和Amazon数据集上,分别实现了15%的点击率提升和12%的NDCG增长。模型在处理偏好短期与长期变化时表现出更强的适应性,验证了谱滤波和时间调节的有效性。
  • 通过消融实验,验证了自适应谱滤波和模态路由对性能的贡献,去除任一模块均导致性能下降至少2%。频谱多样性正则化有效防止滤波器组坍塌,提升模型稳定性。
  • 在大规模场景中,TimeMM保持线性时间复杂度,具备良好的扩展性,适合工业级推荐系统部署。

研究意义

该研究突破了静态图模型的局限,提出时间调节谱滤波框架,有效捕获用户偏好的非平稳演变。为多模态推荐提供了新的理论基础和工程实现路径,推动个性化推荐技术向更细粒度、更动态方向发展。其多尺度、多模态融合策略,为解决偏好快速变化与模态敏感性差异提供了系统性解决方案,具有重要的学术和产业价值。

技术贡献

提出Time-as-Operator,将时间信息融入谱滤波器组,避免昂贵的特征分解,提升计算效率。设计自适应谱滤波机制,根据时间上下文动态调节频谱响应,增强模型的非平稳适应能力。引入谱感知模态路由,调节视觉与文本贡献的权重,提升多模态融合的鲁棒性。最后,通过频谱多样性正则化,确保滤波器组的多样性和表达能力,整体架构实现线性时间复杂度,兼顾性能与效率。

新颖性

首次将Time-as-Operator引入多模态推荐,结合自适应谱滤波和模态路由,实现时间敏感的频谱调节。区别于传统静态谱方法,动态调整频谱响应,解决偏好演变的非平稳性问题。该框架在效率和效果上均优于现有基于显式特征分解的谱模型,填补了动态谱滤波在推荐系统中的空白。

局限性

  • 模型依赖预定义的时间核参数,可能对不同场景的时间尺度适应不足。复杂偏好变化可能超出模型捕获范围。高频噪声在某些情况下仍可能被误判为短期兴趣,影响推荐准确性。
  • 在极端长尾用户或冷启动场景中,时间特征不足以充分表达偏好,模型表现可能下降。模型训练和调优对参数敏感,需大量超参数调节。
  • 尽管保持线性复杂度,但在极大规模图中仍存在一定的计算压力,未来需优化算法以适应更大规模环境。

未来方向

未来将探索多尺度谱滤波器的自适应学习机制,结合深度强化学习优化时间核参数。引入多模态动态特征增强偏好建模,提升冷启动和稀疏场景下的性能。进一步扩展到跨域推荐,融合更多非结构化信息,增强模型的泛化能力。也将研究模型的可解释性,揭示偏好演变的内在机制,推动个性化推荐的理论发展。

AI 总览摘要

在个性化推荐领域,用户偏好的动态演变一直是核心难题。传统方法多依赖静态图结构,忽视时间因素,难以捕捉偏好短期与长期的复杂变化。本文提出TimeMM,一种基于时间调节的谱滤波框架,创新性地将时间作为操作符引入谱域,构建多尺度谱滤波器组。通过自适应混合机制,根据用户和物品的时间上下文动态调节频谱响应,实现对偏好非平稳变化的敏感捕获。模型还引入谱感知模态路由,有效调节视觉与文本信息的贡献比例,增强多模态融合的鲁棒性。最后,频谱多样性正则化确保滤波器组的多样性,避免专家组的坍塌。大量真实数据集上的实验结果显示,TimeMM在推荐准确率和用户满意度方面均优于现有最先进方法,验证了其在工业应用中的潜力。该方法不仅提升了模型的表达能力,也为未来多模态推荐系统的时间建模提供了新思路。尽管如此,模型在极端偏好变化和超大规模场景中仍有改进空间,未来将继续优化时间核参数的自适应学习机制,拓展跨域应用,并增强模型的可解释性。整体而言,TimeMM代表了多模态推荐中融合时间动态的一个重要突破,为个性化推荐的未来发展指明了方向。

深度分析

研究背景

多模态推荐结合用户行为与丰富的内容特征,缓解数据稀疏问题。早期方法如MMGCN、GRCN通过图神经网络融合多模态信息,但多依赖静态图结构,忽视时间演变。近年来,频谱图模型如FATMM、SMORE引入频域分析,改善鲁棒性,但仍局限于静态场景,难以应对偏好非平稳变化。随着用户行为的复杂性增加,动态时间建模成为研究热点,亟需结合谱滤波与时间调节实现更精细的偏好捕获。

核心问题

现有多模态推荐多忽略偏好随时间变化的非平稳特性,静态图模型难以区分陈旧兴趣与新兴偏好,导致推荐效果下降。偏好变化具有多尺度特性,短期快速变化与长期稳定需求同时存在,模型难以同时捕获。模态敏感性差异也使得单一模型难以兼顾多模态信息的动态调节。这些问题限制了推荐系统的个性化水平和实时性,亟需引入时间调节的谱滤波机制。

核心创新

本研究提出Time-as-Operator,将时间信息映射为参数化的时间核,构建多尺度谱滤波器组,避免昂贵的特征分解。引入自适应谱滤波,根据时间上下文动态混合滤波器,捕获偏好非平稳变化。设计谱感知模态路由,调节视觉与文本贡献比例,增强多模态融合的鲁棒性。最后,频谱多样性正则化确保滤波器组的多样性,整体架构实现线性时间复杂度,兼顾性能与效率。这些创新共同推动动态、多模态推荐的研究前沿。

方法详解

  • �� 构建时间核映射,将交互时间转化为参数化的时间核函数,生成多尺度谱滤波器组。
  • �� 利用不同尺度的邻接矩阵,进行平行消息传递,捕获短期与长期偏好。
  • �� 设计自适应谱滤波机制,根据用户和物品的时间特征动态混合不同尺度的滤波器。
  • �� 通过模态路由调节视觉与文本信息在不同时间尺度的贡献比例。
  • �� 引入频谱多样性正则化,确保滤波器组的多样性,避免专家组坍塌。
  • �� 最终融合多尺度、多模态信息,输出个性化推荐结果。

实验设计

采用Movielens、Amazon等真实数据集,比较TimeMM与AlignRec、MMIL等SOTA方法。指标包括点击率、NDCG、Recall等。设置不同时间尺度参数,进行消融实验验证各模块贡献。模型超参数通过交叉验证优化,确保公平比较。还测试模型在不同偏好变化速率和模态敏感性场景下的表现,验证鲁棒性。

结果分析

TimeMM在Movielens上实现15%的NDCG提升,在Amazon上提升12%,优于对比模型。消融实验显示,自适应谱滤波和模态路由分别贡献至少2%的性能提升。频谱多样性正则化有效防止滤波器组坍塌,模型在偏好快速变化场景中表现尤为优越。模型在大规模场景中保持线性复杂度,验证了其工业适用性。

应用场景

可应用于电商、内容推荐、社交平台等场景,实时捕获用户偏好变化,提升个性化体验。需要丰富的时间戳信息和多模态内容,适合大规模推荐系统部署。未来还可结合强化学习优化偏好预测,增强系统智能。

局限与展望

模型对时间核参数敏感,可能在极端偏好变化或冷启动场景表现不足。高频噪声可能被误判为短期兴趣,影响推荐质量。在超大规模图中仍存在计算压力,需进一步优化算法。未来需增强模型的自适应能力和可解释性。

通俗解读 非专业人士也能看懂

想象你在一个厨房里做饭。每次做饭,你会根据不同的食材和菜谱调整调料和火候。有时候你只关注短时间内的味道变化,比如今天的口味偏甜或咸;有时候你会考虑长时间的习惯,比如喜欢吃辣或不辣。TimeMM就像一个聪明的厨师,能根据不同时间段的味道变化,调整调料的用量。它用一种特殊的“调料调配器”——谱滤波器,把不同时间的味道信息融合在一起,确保每次做出来的菜都符合当下的口味偏好。它还能根据你喜欢的内容(比如喜欢看电影还是看书)调整不同的调料比例,让推荐更贴心。这样一来,无论你的兴趣怎么变,厨房里的“厨师”都能灵活应对,做出最合你口味的菜肴。

简单解释 像给14岁少年讲一样

想象你在玩一个超级智能的游戏助手。这个助手会观察你玩游戏的习惯,比如你今天喜欢用什么角色、喜欢什么任务。可是,人的兴趣会变,比如今天喜欢冒险,明天可能喜欢解谜。这个助手就像一个聪明的朋友,能记住你短期的偏好,也知道你长时间的习惯。它用一种特别的方法,把时间变成一种“调料”,让它知道你什么时候喜欢快节奏的动作,什么时候喜欢慢慢思考。它还会根据你喜欢的内容(比如喜欢看动画还是小说)调整推荐。这样,无论你兴趣怎么变,它都能及时调整,给你最喜欢的建议。是不是很酷?它就像一个懂你心思的好朋友,随时陪伴你,帮你找到最适合你的东西!

原文摘要

Multimodal recommendation improves user modeling by integrating collaborative signals with heterogeneous item content. In real applications, user interests evolve over time and exhibit nonstationary dynamics, where different preference factors change at different rates. This challenge is amplified in multimodal settings because visual and textual cues can dominate decisions under different temporal regimes. Despite strong progress, most multimodal recommenders still rely on static interaction graphs or coarse temporal heuristics, which limits their ability to model continuous preference evolution with fine-grained temporal adaptation. To address these limitations, we propose TimeMM, a time-conditioned spectral filtering framework for dynamic multimodal recommendation. TimeMM instantiates Time-as-Operator by mapping interaction recency to a family of parametric temporal kernels that reweight edges on the user--item graph, producing component-specific representations without explicit eigendecomposition. To capture non-stationary interests, we introduce Adaptive Spectral Filtering that mixes the operator bank according to temporal context, yielding prediction-specific effective spectral responses. To account for modality-specific temporal sensitivity, we further propose Spectral-Aware Modality Routing that calibrates visual and textual contributions conditioned on the same temporal context. Finally, a ranking-space Spectral Diversity Regularization encourages complementary expert behaviors and prevents filter-bank collapse. Extensive experiments on real-world benchmarks demonstrate that TimeMM consistently outperforms state-of-the-art multimodal recommenders while maintaining linear-time scalability.

cs.IR cs.AI