SEMPO: Lightweight Foundation Models for Time Series Forecasting

TL;DR

SEMPO为时间序列预测设计的轻量级基础模型,结合能量感知频谱分解与提示混合Transformer。

cs.LG 🔴 高级 2025-10-22 48 次浏览
Hui He Kun Yi Yuanchi Ma Qi Zhang Zhendong Niu Guansong Pang
时间序列预测 基础模型 频谱分析 Transformer 模型压缩

核心发现

方法论

SEMPO由能量感知频谱分解(EASD)和提示混合Transformer(MoPFormer)两大模块组成。EASD通过自适应能量阈值,将频谱划分为高低能量部分,利用多频段掩码强化低能量频率信号的利用,改善模型对微弱但信息丰富的频谱的捕获。MoPFormer引入小规模任务特定提示,动态路由时间序列tokens到不同专家,提升模型参数效率和跨域适应能力。预训练采用能量感知重建目标,结合多域数据,增强迁移能力。微调阶段通过提示调优,适应特定任务。整个架构显著减小模型规模和预训练数据需求,保持优异的泛化性能。

关键结果

  • 在16个数据集的两个大规模基准上,SEMPO在零样本和少样本场景中均优于SOTA方法,参数仅为6.5M,预训练83M时间点,超越参数量级数百倍模型,平均误差降低12%(零样本)和22%(少样本)。
  • 在ETTh1、ETTm2等数据集上,误差指标MSE和MAE均优于现有主流模型,尤其在多域迁移和少样本学习中表现出强鲁棒性。
  • 消融实验显示,EASD显著提升低能量频谱的利用率,MoP机制增强跨域适应性,联合使用效果优于单一模块。

研究意义

该研究突破了时间序列基础模型对大规模数据和庞大网络的依赖,提出的轻量级方案在资源受限环境中依然保持强大性能。其频谱分解机制丰富了模型对复杂动态的理解能力,推动了模型在工业、能源、气候等实际场景中的应用潜力。模型参数和预训练数据的显著减少,为时间序列预训练模型的普及提供了新思路,有望引领未来轻量化、泛化能力强的时间序列预测技术发展。

技术贡献

本文提出的EASD模块创新性地结合频谱能量自适应分割,强化低能量频段信号的建模,弥补现有模型偏向高能量频谱的缺陷。MoPFormer通过引入小规模提示专家池和动态路由机制,有效降低模型复杂度同时增强跨域泛化能力。两者结合实现了模型参数和预训练数据的双重压缩,提供了理论上的频谱利用优化和工程上的参数效率提升。预训练采用能量感知重建目标,结合多域数据,增强迁移能力,显著优于传统大模型。

新颖性

首次将能量感知频谱分解引入时间序列预训练,系统性改善低能量频段信号的利用率,突破了模型偏向高能量频谱的局限。提出的MoPFormer引入小规模提示专家池,动态路由机制在多域时间序列中的应用,为模型轻量化和跨域适应提供新思路。这两项创新结合实现了模型参数和预训练数据的双重压缩,具有较强的创新性和实用价值。

局限性

  • 模型在极端噪声环境或频谱极度稀疏的场景下表现仍有限,因频谱分解对信号质量敏感。
  • 预训练依赖多域数据集,若目标域差异过大,迁移效果可能减弱。
  • 尽管参数显著减少,但在某些复杂任务中仍需进一步优化模型结构和训练策略。

未来方向

未来将探索更自适应的频谱分解策略,结合深度学习中的自监督机制优化频谱利用效率。还计划引入多尺度、多模态信息融合,提升模型在复杂环境中的鲁棒性。此外,将研究模型在实时预测和边缘计算设备上的部署效率,推动其在工业自动化和智能制造中的应用。

AI 总览摘要

随着大规模预训练模型在时间序列预测中的崛起,性能的提升伴随着模型庞大和计算成本的增加,限制了其在资源有限环境中的应用。为解决这一难题,Hui He等提出了SEMPO,一种轻量级基础模型,结合能量感知频谱分解和提示混合Transformer,有效降低模型规模和预训练数据需求。

SEMPO的核心创新在于EASD模块,通过自适应能量阈值,将频谱划分为高低能量部分,利用多频段掩码强化低能量频谱的建模能力,弥补现有模型偏向高能量频段的缺陷。配合MoPFormer模块,模型引入小规模任务提示专家池,通过动态路由机制,有效捕获异质时间序列中的多样化模式。

在两个大规模基准上,SEMPO在16个数据集的零样本和少样本预测场景中,均优于参数量级数百的SOTA模型,误差平均降低12%和22%。实验结果验证了其在跨域迁移和资源受限环境中的优越性。该研究不仅推动了时间序列预训练模型的轻量化发展,也为工业、能源、气候等领域的实际应用提供了新思路。

未来,作者计划优化频谱分解策略,结合多模态信息,提升模型鲁棒性和实时性能,推动其在边缘计算和工业自动化中的应用落地。

深度分析

研究背景

时间序列预测作为工业、气候和能源等领域的核心任务,经历了从统计模型如指数平滑到深度学习架构的演变。Transformer等模型引入后,显著提升了预测精度,但依赖庞大参数和海量数据,限制了实际部署。近年来,预训练基础模型如Moirai、Chronos等在多域迁移中展现潜力,但其规模庞大,计算成本高昂。轻量化模型的研究逐渐兴起,尝试在保持性能的同时减小模型规模,然而仍面临数据利用不足和跨域适应性差的问题。

核心问题

现有时间序列预训练模型普遍依赖大规模数据和庞大网络,导致训练成本高、部署困难,特别是在资源受限环境中表现不佳。模型偏向高能量频谱,忽略微弱但重要的低能量频段信号,影响泛化能力。如何在保证模型性能的同时,显著减小模型规模和预训练数据,是当前亟待解决的核心问题。解决这一问题,不仅需要改进频谱利用机制,还需设计参数高效的模型结构,以实现跨域迁移和少样本学习。

核心创新

本文提出两大创新:第一,EASD模块通过自适应能量阈值,将频谱划分为高低能量部分,增强低能量频段的建模能力,改善模型对微弱信号的捕获。第二,MoPFormer引入小规模提示专家池,结合动态路由机制,提升模型对异质时间序列的适应性,降低参数规模。这两者结合,实现了模型参数和预训练数据的双重压缩,突破了传统大模型的限制。创新点在于频谱能量感知和提示机制的结合,极大提升了模型的效率和泛化能力。

方法详解

  • �� 频谱分解:将时间序列经过FFT变换,利用自适应能量阈值将频谱划分为高低能量部分。
  • �� 多频段掩码:在高低能量频谱中,生成多个频段掩码,选择性抑制特定频率范围。
  • �� 逆FFT重建:频谱掩码后,利用逆FFT还原时域信号,增强低能量频谱的表达。
  • �� Patchify与投影:将频谱处理后的信号划分为不重叠块,线性投影为Transformer输入。
  • �� MoP机制:引入任务特定提示,通过动态路由,将不同时间序列tokens分配到不同专家,提升模型适应性。
  • �� Transformer架构:采用多层堆叠的MoPFormer块,结合标准自注意力机制和提示融合,进行序列建模。
  • �� 预训练:采用能量感知的重建目标,利用多域数据进行自监督训练。
  • �� 微调:冻结Transformer骨架,仅调优提示和预测头,适应特定任务。

实验设计

使用涵盖能源、气候、交通等多个领域的83M时间点数据进行预训练,评估在TSLib和GIFT-Eval基准上的零样本和少样本预测性能。对比模型包括大规模预训练模型(如Time-MoE、Chronos)和轻量模型(如Moirai、TimesFM)。指标主要为MSE和MAE,重点考察模型在不同预测步长和跨域迁移中的表现。还进行了消融实验验证频谱分解和提示机制的贡献。

原文摘要

The recent boom of large pre-trained models witnesses remarkable success in developing foundation models (FMs) for time series forecasting. Despite impressive performance across diverse downstream forecasting tasks, existing time series FMs possess massive network architectures and require substantial pre-training on large-scale datasets, which significantly hinders their deployment in resource-constrained environments. In response to this growing tension between versatility and affordability, we propose SEMPO, a novel lightweight foundation model that requires pretraining on relatively small-scale data, yet exhibits strong general time series forecasting. Concretely, SEMPO comprises two key modules: 1) energy-aware SpEctral decomposition module, that substantially improves the utilization of pre-training data by modeling not only the high-energy frequency signals but also the low-energy yet informative frequency signals that are ignored in current methods; and 2) Mixture-of-PrOmpts enabled Transformer, that learns heterogeneous temporal patterns through small dataset-specific prompts and adaptively routes time series tokens to prompt-based experts for parameter-efficient model adaptation across different datasets and domains. Equipped with these modules, SEMPO significantly reduces both pre-training data scale and model size, while achieving strong generalization. Extensive experiments on two large-scale benchmarks covering 16 datasets demonstrate the superior performance of SEMPO in both zero-shot and few-shot forecasting scenarios compared with state-of-the-art methods. Code and data are available at https://github.com/mala-lab/SEMPO.

cs.LG