核心发现
方法论
PromptCast把历史数值序列改写为自然语言输入,把未来数值改写为目标句子,以句到句生成替代数值回归。论文构建PISA数据集,并用T5、BART、BERT、RoBERTa、LED等语言模型进行标准序列到序列微调;预测后通过字符串解析恢复数值,再计算RMSE与MAE。
关键结果
- 在CT、ECL、SG三类数据上,最佳PromptCast模型分别达到RMSE 6.351、519.665和8.260;对应MAE为4.707、350.699和5.785。CT和ECL结果整体优于或接近最佳数值模型。
- PISA含311,932个实例:CT为110个城市,ECL为50名用户,SG为324个POI,统一使用15天历史窗口。数值基线包括LSTM、TCN、Transformer、Informer、Autoformer和FEDformer。
- 文本生成存在格式失败风险。论文引入Missing Rate;示例中CT上ProphetNet、Electra、BERT分别为0.412%、0.319%和0.244%,说明语言模型不仅要预测数值,还要遵守输出模板。
研究意义
研究把时间序列预测连接到预训练语言模型生态,降低了针对每个新场景设计专门架构和复杂调参的需求。它证明天气、用电和客流等异构数据可通过统一文本接口处理,并为面向普通用户的预测问答系统提供路径。更重要的是,PromptCast在零样本设定下表现出比传统数值模型更强的潜在迁移能力,推动预测从专用模型走向通用模型。
技术贡献
核心工程贡献是一个不修改语言模型架构的数据到文本协议:模板将历史值、时间范围、对象身份和预测问题组织成输入,将标签组织成输出。论文同时提供PISA-numerical与PISA-prompt的实例对齐、统一训练划分和可复现实验。评估上加入Missing Rate,并把生成结果解析回数值,使生成式模型能够与RMSE、MAE体系下的LSTM、TCN及FEDformer直接比较。
新颖性
论文声称首次以自然语言生成方式处理一般时间序列预测,而非仅把文本作为辅助特征。与Informer、Autoformer、FEDformer等仍在数值空间内改造注意力或分解模块的方法不同,PromptCast改变了任务接口本身:输入和输出都是句子,从而直接调用T5、BART等既有语言生成模型。
局限性
- 数值被离散地写入文本,可能损失连续性与精度;模型还可能生成无法解析的句子,因此Missing Rate成为额外失败模式。
- PISA仅覆盖日级单步预测为主的天气、用电和客流,数据规模与领域多样性仍不足以证明对金融、工业传感器等场景的普适性。
- 实验主要采用模板和默认超参数,尚未系统研究不同语言表达、数值编码、量化精度与真正大规模基础模型的影响。
未来方向
后续可研究多步、长序列和多变量PromptCast,设计更稳健的数值词元化、约束解码与不确定性表达机制。还应扩大跨领域数据,测试真正零样本和跨数据集迁移,并比较更大的语言模型、检索增强及自然语言解释能力。
AI 总览摘要
时间序列预测通常把一串数字输入专门的回归模型,再输出另一串数字。LSTM、TCN以及Transformer系的Informer、Autoformer和FEDformer已经显著提升了性能,但每个新领域往往仍需重新设计特征、窗口和超参数。PromptCast提出了不同视角:能否像翻译句子一样,让语言模型完成预测?
该方法把历史数据改写成带有时间、对象和数值的句子,把未来值写成答案句。例如,过去15天的温度被描述为一段文本,模型回答“明天将是78度”。论文发布PISA数据集,包含311,932个实例,覆盖110个城市温度、50名用户用电和324个POI客流。T5、BART、BERT、RoBERTa、BigBird、LED等模型均可通过标准序列到序列微调使用,无需改造核心架构。
结果表明,最佳文本模型在CT、ECL、SG上的RMSE分别为6.351、519.665和8.260,MAE分别为4.707、350.699和5.785;在多个场景中达到或超过数值基线。其代价是生成格式可能失败,论文因此报告Missing Rate。PromptCast尚不是成熟的通用预测器,但它展示了统一语言接口、零样本迁移和预测聊天机器人的可行方向。
深度分析
研究背景
时间序列方法经历了统计模型、LSTM/TCN到Transformer的发展。Informer、Autoformer和FEDformer通过稀疏注意力、序列分解或频域建模改善长序列预测;然而它们仍要求数值输入、专门训练和场景调参。与此同时,BERT、T5等预训练模型在语言任务中展现迁移能力,促使作者探索其能否处理非语言序列。
核心问题
传统任务定义为给定对象Um在tobs个时间步的数值x^m_{t1:tobs},预测未来n步。难点包括不同量纲、时间语义、多变量关系和跨领域迁移。语言模型原生处理离散文本,不能直接理解连续数值,因此关键问题是如何把数值序列转成可学习、可解析且不丢失预测信息的语言接口。
核心创新
- �� 提出PromptCast,把预测重构为句到句生成。
- �� 发布PISA,统一提供PISA-numerical与PISA-prompt,支持公平比较。
- �� 设计CT、ECL、SG三套模板,把上下文、问题和答案明确分开。
- �� 引入Missing Rate,衡量生成文本无法恢复数值的比例。
- �� 用标准HuggingFace Trainer和现成语言模型验证无需架构改造的可行性。
方法详解
- �� 数据输入:每个样本使用15天历史窗口和下一天标签,滑动步长为1天。
- �� 文本化:CT写为温度句子,ECL写为每日用电句子,SG写为POI访客句子;问题指向tobs+1。
- �� 模型:T5、BART、ProphetNet、BigBird、LED、Pegasus及BERT、RoBERTa、Electra等进行序列到序列微调。
- �� 解码:使用HuggingFace标准tokenizer生成答案,再以字符串解析提取数值。
- �� 评估:RMSE=sqrt(mean((y-yhat)^2)),MAE=mean(|y-yhat|),并报告Missing Rate=(ntest-ndecoded)/ntest×100%。
实验设计
CT覆盖2017/01/01—2020/04/30的110城;ECL覆盖50名用户;SG覆盖324个POI。各子集按时间7:1:2划分训练、验证和测试。数值基线包括Copy Yesterday、Historical Average、Copy Last Week、AutoARIMA、LSTM、TCN、Transformer、Informer、Autoformer和FEDformer;文本基线为10种生成模型。深度模型运行5个随机种子,主要采用官方默认设置。
结果分析
数值模型中,CT最佳FEDformer RMSE为6.358,ECL最佳Informer为536.921,SG最佳Informer为8.151。文本模型中,BigBird在CT/ECL达到6.351/519.665,RoBERTa在SG达到8.260;对应MAE为4.707、350.699和5.785。结果显示文本方法在CT、ECL具有竞争力,但SG仍略逊最佳数值模型;生成合法性仍需单独监控。
应用场景
天气服务可把城市历史温度直接交给预测聊天机器人;能源平台可让用户用自然语言询问下一日负荷;零售和城市管理者可预测门店、景点或POI客流。部署前需固定模板、保证时间序列清洗,并设置数值解析失败处理和置信度提示。
局限与展望
模板化文本可能造成数值精度、时间关系和单位信息损失;自由生成还会产生无法解析的答案。数据仅覆盖三种日级场景,不能代表高频传感器、金融或长周期预测。实验以单步预测和默认超参数为主,且语言模型推理成本可能高于轻量数值模型。未来需结合连续数值编码、约束解码、多步与多变量训练,以及更大规模跨领域测试。
通俗解读 非专业人士也能看懂
把传统预测想成一个只会看数字的天气员:你给它一排温度,它计算后给出下一天温度。PromptCast换了一种办法,把这排数字写成一张完整便条:“过去15天,这座城市每天是多少度;明天会是多少度?”然后交给一个原本擅长读句子的助手。助手读完便条,写出“明天是78度”。
这种做法像把不同部门都改用同一种表格语言。天气、用电和客流虽然数字大小完全不同,但都能写成“过去发生了什么—请预测下一天—答案是多少”。PISA就是这样制作的共享题库,共有311,932道题。研究者可以比较普通数字预测器和语言助手到底谁更准。
它并非魔法:如果助手写出格式不对的答案,研究者就无法读出数字,所以还要统计Missing Rate。它在部分数据上很强,却不代表语言模型已经全面取代专业预测器。真正价值在于,它让预测更容易通过聊天方式使用,也可能帮助一个模型适应更多任务。
简单解释 像给14岁少年讲一样
想象你每天记录学校食堂卖出多少份午餐。以前的预测程序像数学计算器:你必须把数字按规定格式输入,它再输出一个数字。PromptCast则像把记录写成聊天:“周一卖了100份,周二卖了120份……明天会卖多少?”语言模型读完后回答:“明天大约卖130份!”
论文把三种真实问题放进同一个“聊天题库”:城市温度、家庭用电和地点客流。这个题库叫PISA,共有311,932个例子。每个例子通常给模型过去15天的信息,让它猜第16天。研究者还测试了T5、BART、BERT和BigBird等模型。
结果很有意思!在城市温度数据上,BigBird的RMSE是6.351;用电数据上是519.665;客流数据上较好的结果是8.260。数字越小通常越好。可是模型有时会写出奇怪答案,例如没有按句子模板回答,程序就读不出预测值,因此还要检查Missing Rate。
所以它像一个会预测的聊天机器人,但还不是万能预言家。它可能不懂突然停电、节日客流暴增等特殊事件,也可能比小型专用程序更耗计算资源。未来如果让它同时看天气、节假日和新闻,预测或许会更聪明。
术语表
PromptCast(提示式时间序列预测)
把数值时间序列改写为自然语言输入,并生成自然语言预测答案。它将预测任务形式化为句到句生成。
论文提出的核心范式。
PISA(提示式时间序列预测数据集)
包含CT、ECL和SG三个场景的大规模数据集,共311,932个实例。它同时提供数值和文本版本。
用于训练、验证和公平基准测试。
RMSE
均方根误差,对较大的预测偏差惩罚更强。公式为sqrt(mean((y-yhat)^2))。
评估恢复出的数值预测。
MAE
平均绝对误差,表示预测值与真实值绝对差异的平均水平。它比RMSE更不易受极端误差影响。
与RMSE共同报告。
Missing Rate
生成结果无法解析出数值的比例,公式为(ntest-ndecoded)/ntest×100%。数值越低越好。
专门衡量文本生成合法性。
开放问题 这项研究留下的未解疑问
- 1 如何在保持自然语言灵活性的同时精确表达小数、单位、连续值和预测区间,仍缺少统一的数值编码与约束解码方案。
- 2 零样本优势尚未在更多领域和真正未见数据分布上充分验证,跨数据集迁移的可靠性仍是开放问题。
- 3 多步、多变量和高频预测可能导致上下文变长、误差累积与计算成本上升,需要新的实验与模型设计。
应用场景
近期应用
预测聊天机器人
客服或运营人员可用自然语言询问明日温度、用电量或客流。部署需要整理历史序列、固定领域模板,并对无法解析的答案进行重试或人工审核。
轻量化业务预测接口
零售、能源和城市管理系统可把统一文本接口接入现有语言模型,快速测试新对象或新场景,减少为每个任务单独开发Transformer预测器的工作。
远期愿景
通用预测助手
未来的助手可结合历史数值、日历、天气和用户问题,统一回答多领域预测请求。实现这一愿景仍需更可靠的数值推理、不确定性表达、实时数据接入和严格安全评估。
原文摘要
This paper presents a new perspective on time series forecasting. In existing time series forecasting methods, the models take a sequence of numerical values as input and yield numerical values as output. The existing SOTA models are largely based on the Transformer architecture, modified with multiple encoding mechanisms to incorporate the context and semantics around the historical data. Inspired by the successes of pre-trained language foundation models, we pose a question about whether these models can also be adapted to solve time-series forecasting. Thus, we propose a new forecasting paradigm: prompt-based time series forecasting (PromptCast). In this novel task, the numerical input and output are transformed into prompts and the forecasting task is framed in a sentence-to-sentence manner, making it possible to directly apply language models for forecasting purposes. To support and facilitate the research of this task, we also present a large-scale dataset (PISA) that includes three real-world forecasting scenarios. We evaluate different SOTA numerical-based forecasting methods and language generation models. The benchmark results with various forecasting settings demonstrate the proposed PromptCast with language generation models is a promising research direction. Additionally, in comparison to conventional numerical-based forecasting, PromptCast shows a much better generalization ability under the zero-shot setting.