One Fits All:Power General Time Series Analysis by Pretrained LM

TL;DR

FPT冻结GPT-2核心模块,统一七类时序任务;长预测平均MSE 0.516,分类准确率74.0%。

cs.LG 🟡 进阶级 2023-02-23 20 次浏览
Tian Zhou PeiSong Niu Xue Wang Liang Sun Rong Jin
时间序列 预训练模型 GPT-2 跨模态迁移 Transformer

核心发现

方法论

Frozen Pretrained Transformer(FPT)保留GPT-2的自注意力与前馈网络并冻结,仅训练输入嵌入、位置嵌入、LayerNorm和输出层。输入先经RevIN归一化,再以Patching聚合相邻时间点形成token,线性映射到GPT-2维度,最后恢复尺度并输出预测或任务结果。

关键结果

  • 长预测覆盖Weather、Traffic、Electricity、ILI及四个ETT数据集,GPT2(6)平均MSE为0.516,较TimesNet的0.596相对下降9.3%。
  • 在10个UEA分类数据集上,GPT2(6)平均准确率74.00%,超过TimesNet的73.60%;在五个异常检测数据集上平均F1为86.72%,超过TimesNet的85.24%。
  • 插补任务中GPT2(3)平均MSE/MAE为0.047/0.127,较TimesNet平均MSE下降4.1%;10%少样本预测平均MSE为0.371,较TimesNet降低33.3%。

研究意义

论文缓解了时间序列缺乏大规模预训练语料的长期瓶颈:无需训练专门的分类器、异常检测器或预测器,即可复用语言模型的通用计算能力。其结果表明,跨模态迁移不仅适用于语言与视觉,也能覆盖工业监控、能源和医疗等时序场景,为低标注、少样本建模提供了统一路线。

技术贡献

技术上,FPT将GPT-2的主要知识参数冻结,只学习模态适配层,降低训练成本并减少灾难性遗忘。RevIN处理分布漂移,Patching扩大历史窗口而控制token长度。论文还从理论和实验上指出,自注意力的行为与PCA相似,能执行与数据内容弱相关的投影操作,这解释了其跨域适应性。

新颖性

相较TimesNet、PatchTST、DLinear等为时间序列专门设计的模型,本文首次系统展示同一冻结预训练Transformer可覆盖分类、异常检测、插补、短期和长期预测,以及少样本、零样本预测。更重要的是,研究将跨模态效果与“注意力近似PCA”的机制联系起来。

局限性

  • GPT-2并非在时间序列上预训练,性能依赖输入嵌入、归一化和patch长度等适配设计;对突发结构、长周期变化或强分布迁移,冻结表示未必充分。
  • 零样本实验主要考察有限数据集之间的迁移,尚不能证明对金融、交通控制等更复杂、非平稳环境具有普遍可靠性。

未来方向

未来应构建更大、更具多领域覆盖性的时间序列语料,研究可控解冻、时间序列专用预训练和跨变量建模;还需验证BERT、BEiT等骨干在更多任务上的稳定性,并降低长序列推理成本,建立不确定性评估与在线更新机制。

AI 总览摘要

时间序列预测、分类和异常检测广泛服务于能源、工业与医疗,但现有方法通常“一种任务一个模型”。与NLP拥有海量文本不同,公开时间序列数据规模不足10GB,难以直接训练基础模型。论文《One Fits All》提出FPT,探索语言模型能否跨越模态鸿沟。

FPT以GPT-2为骨干,冻结自注意力和前馈层,只训练输入嵌入、位置嵌入、LayerNorm及输出层。时间序列先由RevIN归一化,再经Patching转换为token。作者认为,自注意力在一定程度上执行类似PCA的低维投影,因此即使训练数据来自语言,它仍能提取时序中的一般模式。BERT和视觉模型BEiT的实验进一步支持这种普适性。

结果覆盖七类任务。长预测中,GPT2(6)平均MSE为0.516,较TimesNet降低9.3%;UEA分类平均准确率为74.00%,异常检测平均F1为86.72%;插补平均MSE为0.047,10%少样本预测平均MSE为0.371,较TimesNet降低33.3%。零样本预测平均指标为16.38,优于DLinear、TimesNet和PatchTST。研究的意义不在于GPT-2已经成为所有时序任务的最优模型,而在于证明冻结的跨模态Transformer可以作为统一计算引擎;其局限是仍依赖任务适配层、数据规模有限,且极端非平稳场景尚未充分验证。

深度分析

研究背景

Transformer已推动Informer、Autoformer、FEDformer、PatchTST和TimesNet等时序模型发展,但这些模型大多按任务设计。NLP中的GPT-2、BERT和CV中的BEiT则通过海量预训练获得跨任务迁移能力。时间序列最大的公开数据集不足10GB,限制了独立基础模型的训练,因此跨模态复用成为关键方向。

核心问题

核心问题是:语言或视觉预训练参数能否在几乎不改动Transformer核心模块的情况下处理数值序列?难点包括数值token与词token的统计差异、变量间相关性、尺度变化、缺失值和长预测窗口;同时还要避免小数据微调造成过拟合或灾难性遗忘。

核心创新

  • ��提出FPT,用冻结GPT-2注意力和FFN统一七类时序任务。
  • ��结合RevIN与Patching完成数值模态适配。
  • ��用GPT2(3)和GPT2(6)验证不同深度的有效性。
  • ��从理论与实验上建立自注意力和PCA的联系。
  • ��以BERT、BEiT验证结构和模态变化下的迁移普适性。

方法详解

  • ��输入:长度为96或更长的多变量序列。
  • ��归一化:RevIN按实例减均值、除标准差,输出端恢复尺度。
  • ��分块:Patching聚合相邻时间点,减少冗余并扩大有效历史窗口。
  • ��嵌入:线性层把patch映射至GPT-2隐藏维度。
  • ��计算:冻结多头自注意力与FFN,微调位置嵌入和LayerNorm。
  • ��输出:任务头分别生成预测、重构、类别或异常分数。
  • ��训练:采用任务损失;异常检测统一使用重构误差。

实验设计

实验覆盖ETTh1、ETTh2、ETTm1、ETTm2、Electricity、Weather、Traffic、ILI、M4、UEA,以及SMD、MSL、SMAP、SWaT、PSM。基线包括TimesNet、PatchTST、DLinear、FEDformer、N-BEATS和Anomaly Transformer。指标包括MSE、MAE、准确率、F1、sMAPE、MASE与OWA;另测试12.5%至50%随机缺失、10%和5%少样本、跨数据集零样本,并比较冻结、随机初始化和无预训练版本。

结果分析

GPT2(6)长预测平均MSE/MAE为0.516/0.407,优于TimesNet的0.596/0.433;分类准确率74.00%,TimesNet为73.60%;异常F1为86.72%,TimesNet为85.24%。插补中GPT2(3)平均MSE为0.047。M4短预测sMAPE为11.991,接近TimesNet的11.829;零样本平均指标16.38,优于PatchTST的17.67。冻结和预训练均带来收益。

应用场景

能源负荷预测可用于调度与需求响应;Weather和Traffic数据支持气象预警、拥堵管理;SMD、SWaT、PSM等工业数据可用于设备监控。医疗、零售和物联网场景若只有少量标签,可优先采用FPT进行少样本迁移,但需重新校准归一化、窗口和输出头。

局限与展望

模型并非真正端到端的时序基础模型,仍需任务数据训练输入与输出层。冻结核心层虽降低成本,却限制了对周期突变、变量机制和极端分布的适应。实验数据集主要来自公开基准,规模和领域覆盖有限;长序列仍受Transformer计算复杂度影响。未来应发展时间序列预训练、参数高效解冻、不确定性预测和在线适应。

通俗解读 非专业人士也能看懂

把FPT想成一位受过多年训练的万能工匠。工匠原本学习的是语言,但训练过程中掌握了更一般的技能:观察许多东西、比较它们的关系、找出最重要的变化。现在给他一串电力用量或机器温度,不必重新教完整套本领,只需换上“翻译器”(输入嵌入),把数字整理成小组(Patching),并先消除不同设备的尺度差异(RevIN)。工匠的核心判断方式保持不变,只调整少量接口,就能预测未来、补齐缺失、判断类别和发现异常。论文数据显示,这种做法在多种任务上接近或超过专门模型,例如长预测平均误差较TimesNet低9.3%。但工匠并不真正理解每个行业;遇到分布突然改变或非常特殊的设备,仍可能需要重新训练更多部分。

简单解释 像给14岁少年讲一样

想象你有一个已经练了很多年、很会找规律的游戏高手。他以前玩的不是“预测电力”游戏,而是文字游戏,但他学会了观察前后关系、找重点和记住顺序。现在你给他温度、电量或交通流量,他不用从零开始,只要把数字切成小卡片,再翻译成他看得懂的格式,就能开始工作。

这就是FPT。它把GPT-2的大部分“脑回路”锁住,只训练入口和出口。入口负责把时间序列变成token,RevIN像把不同人的身高统一到同一把尺子,Patching则像把连续几秒合成一张小卡片。出口再把结果变回预测数字、类别或异常警报。

结果很酷:长预测平均MSE为0.516,优于TimesNet的0.596;分类准确率74.00%;异常检测F1为86.72%。即使只给10%的训练数据,平均MSE也比TimesNet低33.3%。这说明旧知识有时真的能帮助新任务!

不过它不是魔法。GPT-2没有专门学习天气或机器,遇到突然停电、传感器换型号等情况可能失灵。未来可以让模型读更多时间序列,并学会在新环境中安全更新。

术语表

Frozen Pretrained Transformer(冻结预训练Transformer)

冻结大部分预训练参数,仅训练少量适配层的Transformer。它能降低计算量并减少小数据微调的遗忘。

论文用FPT统一处理七类时间序列任务。

Self-Attention(自注意力)

根据不同位置之间的相关性分配权重,从而聚合序列信息。论文认为其行为类似PCA的主成分投影。

GPT-2中的自注意力被保留且冻结。

Patching(分块)

把相邻时间点合并为一个局部片段。这样可减少token数量并保留局部模式。

FPT在RevIN之后使用Patching构造输入token。

RevIN(可逆实例归一化)

按单个样本去除均值和尺度差异,并在输出端恢复原始统计量。它用于缓解分布漂移。

论文将RevIN作为跨模态输入适配模块。

Few-shot / Zero-shot

Few-shot只使用少量目标数据;Zero-shot不使用目标数据训练。二者衡量迁移与泛化能力。

论文分别测试10%、5%训练数据及跨数据集零样本预测。

开放问题 这项研究留下的未解疑问

  • 1 注意力近似PCA的解释仍不完整:尚不清楚不同层、头和位置编码分别承担什么时序功能。
  • 2 公开基准规模有限,FPT能否迁移到金融、医疗等高噪声和强非平稳数据,仍缺乏系统证据。
  • 3 冻结模型的计算效率、长序列扩展性和预测不确定性尚未充分评估。

应用场景

近期应用

工业异常监控

企业可将SMD、SWaT或PSM式传感器流输入FPT,通过重构误差发现设备异常。需要历史窗口、少量正常数据及合理的RevIN和阈值校准。

能源与交通预测

电力公司和交通平台可用Electricity、Traffic等数据微调输出层,预测负荷或流量。FPT适合标签有限的部门,但部署前需验证数据频率、缺失模式和分布漂移。

远期愿景

通用时序基础模型

若结合跨行业时间序列预训练,模型可像通用分析平台一样共享表示,在预测、插补、分类和告警之间迁移,减少每个业务单独开发模型的成本。

原文摘要

Although we have witnessed great success of pre-trained models in natural language processing (NLP) and computer vision (CV), limited progress has been made for general time series analysis. Unlike NLP and CV where a unified model can be used to perform different tasks, specially designed approach still dominates in each time series analysis task such as classification, anomaly detection, forecasting, and few-shot learning. The main challenge that blocks the development of pre-trained model for time series analysis is the lack of a large amount of data for training. In this work, we address this challenge by leveraging language or CV models, pre-trained from billions of tokens, for time series analysis. Specifically, we refrain from altering the self-attention and feedforward layers of the residual blocks in the pre-trained language or image model. This model, known as the Frozen Pretrained Transformer (FPT), is evaluated through fine-tuning on all major types of tasks involving time series. Our results demonstrate that pre-trained models on natural language or images can lead to a comparable or state-of-the-art performance in all main time series analysis tasks, as illustrated in Figure 1. We also found both theoretically and empirically that the self-attention module behaviors similarly to principle component analysis (PCA), an observation that helps explains how transformer bridges the domain gap and a crucial step towards understanding the universality of a pre-trained transformer.The code is publicly available at https://github.com/DAMO-DI-ML/One_Fits_All.

cs.LG cs.AI