Reverso: Efficient Time Series Foundation Models for Zero-shot Forecasting

TL;DR

Reverso模型通过长卷积和线性RNN层实现高效的零样本时间序列预测,参数量减少百倍。

cs.LG 🔴 高级 2026-02-20 5 次浏览
Xinghong Fu Yanhong Li Georgios Papaioannou Yoon Kim
时间序列 零样本预测 深度学习 高效模型 卷积网络

核心发现

方法论

本文提出了一种高效的时间序列基础模型Reverso,通过多尺度输入策略、长卷积和DeltaNet层交替的混合序列层,以及基于注意力的解码头实现。该方法无需大型Transformer模型,依然能达到高效的零样本预测性能。

关键结果

  • Reverso在Gift-Eval基准测试中取得了0.691的MASE值,参数仅为2.6M,相较于较大模型如Xihe-Max(1.5B参数)表现更优。
  • 在LTSF测试集中,Reverso超越了Sundial和Super-Linear等模型,尽管参数量更小。
  • Reverso在中长预测任务中表现突出,尤其在Gift-Eval的长序列任务中表现优异。

研究意义

Reverso模型在时间序列预测领域具有重要意义,尤其在资源受限的设备上。它降低了模型的训练和部署成本,同时在多个基准测试中表现优异,推动了性能与效率的帕累托前沿。

技术贡献

Reverso通过结合长卷积和DeltaNet层,提出了一种新颖的混合序列混合策略,显著减少了参数量。其多尺度输入策略和注意力解码头在不增加序列长度的情况下有效建模长上下文。

新颖性

Reverso首次展示了小型混合模型可以在零样本时间序列预测中匹敌大型Transformer模型,提供了一种高效的替代方案。

局限性

  • Reverso主要针对单变量预测,尚未充分探索多变量时间序列的潜力。
  • 在短序列预测中,Reverso的表现仍不及一些大型模型。

未来方向

未来可以探索Reverso在多变量时间序列中的应用,以及如何进一步提升其在短序列预测中的性能。

AI 总览摘要

Reverso模型通过结合多尺度输入、长卷积和DeltaNet层,提供了一种高效的时间序列预测方案。现有的大型Transformer模型虽然性能优越,但在资源受限的环境中难以部署。Reverso通过减少参数量,显著降低了计算和存储成本。

在实验中,Reverso在Gift-Eval和LTSF等基准测试中表现优异,尤其在长序列预测任务中超越了许多参数更大的模型。其多尺度输入策略和注意力解码头使得模型能够在不增加序列长度的情况下有效建模长上下文。

尽管Reverso在单变量预测中表现突出,但在多变量时间序列和短序列预测中仍有提升空间。未来的研究可以探索如何在这些领域中进一步优化Reverso的性能。

深度分析

研究背景

时间序列预测是机器学习中的核心问题,广泛应用于天气预报、能源分析、供应链物流等领域。传统上,统计模型和基于RNN的深度学习方法在该领域取得了成功。近年来,Transformer架构的引入进一步提升了预测性能。

核心问题

现有的时间序列基础模型通常规模庞大,参数量达到数亿级别,导致在资源受限的设备上难以部署。如何在保持高性能的同时,显著减少模型的参数量和计算成本,是一个亟待解决的问题。

核心创新

Reverso通过多尺度输入策略、长卷积和DeltaNet层的混合序列层,以及注意力解码头,实现了高效的时间序列预测。与大型Transformer模型相比,Reverso的参数量减少了百倍。

方法详解

  • �� 多尺度输入策略:通过不同尺度的下采样创建多版本输入。
  • �� 混合序列层:交替使用长卷积和DeltaNet层进行序列混合。
  • �� 注意力解码头:利用上下文表示进行预测。
  • �� 数据增强和推理策略:进一步提升性能。

实验设计

实验在Gift-Eval和LTSF等基准测试上进行,使用AdamW优化器,最大学习率为5×10^-4。模型在多个数据集上进行训练和测试,评估其在零样本预测、分类和异常检测中的表现。

结果分析

Reverso在Gift-Eval基准测试中取得了0.691的MASE值,超越了许多参数更大的模型。在LTSF测试集中,Reverso也表现优异,尤其在长序列任务中。

应用场景

Reverso适用于资源受限的设备,如边缘计算和移动设备,在这些场景中,模型的高效性尤为重要。

局限与展望

Reverso主要针对单变量预测,多变量时间序列的潜力尚未充分探索。此外,在短序列预测中,Reverso的表现仍不及一些大型模型。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,Reverso就像一个高效的厨师助手。传统的模型就像需要很多厨具和步骤的大餐,而Reverso则是一个精简的多功能厨具,能快速完成同样的任务。它通过多尺度输入策略,就像不同的切菜方式,帮助模型更好地理解数据。长卷积和DeltaNet层就像不同的烹饪技巧,交替使用,使得模型能更好地处理复杂的时间序列数据。

简单解释 像给14岁少年讲一样

嘿,小朋友!想象一下你在玩一个超级酷的游戏,Reverso就像是你的秘密武器。其他玩家需要很多装备才能赢,而Reverso就像一个小而强大的工具包,能帮你轻松搞定所有挑战。它能快速分析游戏中的各种数据,就像一个聪明的助手,帮你做出最佳决策。是不是很酷?

术语表

Reverso

一种高效的时间序列基础模型,结合多尺度输入和混合序列层。

用于零样本时间序列预测。

DeltaNet

一种线性RNN层,结合查询、键和值向量进行状态转换。

在Reverso中用于序列混合。

多尺度输入

通过不同尺度的下采样创建多版本输入。

帮助模型在不增加序列长度的情况下建模长上下文。

长卷积

使用深度可分离卷积进行序列混合的层。

在Reverso中用于处理长序列数据。

注意力解码头

基于上下文表示进行预测的解码器。

在Reverso中用于最终输出预测。

开放问题 这项研究留下的未解疑问

  • 1 如何在多变量时间序列中有效应用Reverso?
  • 2 如何提升Reverso在短序列预测中的性能?

应用场景

近期应用

边缘设备预测

Reverso可用于边缘设备上的时间序列预测,降低计算和存储成本。

远期愿景

大规模部署

Reverso有潜力在大规模物联网设备中实现高效的时间序列预测。

原文摘要

Learning time series foundation models has been shown to be a promising approach for zero-shot time series forecasting across diverse time series domains. Insofar as scaling has been a critical driver of performance of foundation models in other modalities such as language and vision, much recent work on time series foundation modeling has focused on scaling. This has resulted in time series foundation models with hundreds of millions of parameters that are, while performant, inefficient and expensive to use in practice. This paper describes a simple recipe for learning efficient foundation models for zero-shot time series forecasting that are orders of magnitude smaller. We show that large-scale transformers are not necessary: small hybrid models that interleave long convolution and linear RNN layers (in particular DeltaNet layers) can match the performance of larger transformer-based models while being more than a hundred times smaller. We also describe several data augmentation and inference strategies that further improve performance. This recipe results in Reverso, a family of efficient time series foundation models for zero-shot forecasting that significantly push the performance-efficiency Pareto frontier.

cs.LG cs.AI