EpiEvolve: Self-Evolving Agents for Streaming Pandemic Forecasting under Regime Shifts

TL;DR

EpiEvolve以记忆自进化适应疫情变局,准确率0.629,恢复滞后由5周降至2周。

cs.AI 🔴 高级 2026-06-04 17 次浏览
Yiming Lu Sihang Zeng Zhengxu Tang Max Lau Fei Liu Wei Jin
流式预测 大语言模型 疫情建模 概念漂移 外部记忆

核心发现

方法论

EpiEvolve包裹经暖启动训练的冻结Qwen3-14B-Base预测器,不在流式阶段更新权重。每周先预测全部50州,再接收延迟标签;系统通过分层情景记忆、结果反思、战略规则蒸馏、漂移检测和制度感知检索,把历史错误转化为提示上下文。检索分数为cos(ϕt,ϕe)·w(ρt,ρe),同制度权重1、跨制度权重α=0.5。

关键结果

  • 在2021-06-07至2022-12-19的81周、4050个州周样本上,EpiEvolve平均准确率为0.629,高于静态PandemicLLM的0.561、流式微调的0.566和CDC集成的0.325。
  • 制度切换后,EpiEvolve平均2周恢复至新制度稳态;PandemicLLM和流式微调均需5周。BA.5与BQ.1上分别达0.563和0.582,显著缓解静态模型的0.431和0.456。
  • 消融显示去除战略记忆准确率降至0.604、去除反思降至0.591、去除漂移检测降至0.612;去除制度感知检索为0.604,说明各机制互补。

研究意义

论文把疫情预测从一次性监督学习重新定义为带延迟反馈的部署过程。它说明模型无需重新训练,也能利用自身已验证的预测经验应对变异株、免疫结构和政策变化。对学术研究而言,方法提供了可复现的时间顺序评测;对公共卫生机构而言,它降低了模型在制度突变后的持续失准风险,并保留冻结模型便于审计、复现与合规部署。

技术贡献

核心贡献是将非参数记忆适应形式化为Mt=(Et,Lt,ρt)。Et按州、HHS区域和全国层级组织预测案例;反思生成错误解释ℓ;战略蒸馏把重复模式写成λ=(preconds,consequent,c,n,ρλ),并用经验精度更新置信度。漂移由误差超出暖启动均值τσ或新变异株字段触发。该设计严格执行批次级延迟反馈,避免同周跨州泄漏。

新颖性

作者称其为首个面向制度变迁流式疫情预测的自进化LLM代理。相较PandemicLLM、Claude-ICL、检索系统或流式微调,创新不在更换骨干,而在把预测—标签—反思—规则蒸馏闭环化,并用制度加权检索实现冻结参数下的快速恢复。

局限性

  • 实验仅覆盖美国50州、COVID住院趋势和五个变异株时期,不能证明对其他疾病、国家或更长危机有效。
  • 反思与规则蒸馏依赖LLM生成质量;错误规则可能被重复强化,且论文未充分报告提示成本、运行时延和跨模型可迁移性。
  • 漂移判据含阈值τ及新变异株文本信号,现实中信号可能迟到、缺失或不可靠。

未来方向

后续应在流感、RSV及国际地区上验证,并研究不确定性校准、自动规则淘汰、可审计因果证据和多模型协作。还需比较不同LLM、检索规模与阈值τ,报告成本、置信区间及极端制度突变下的安全策略。

AI 总览摘要

疫情预测的难点不只是从历史数据推断下一周趋势,而是模型发布后,真实标签往往延迟到达,病毒变异、免疫水平和政策环境却持续改变。传统静态模型在部署后不能吸收自己的错误;流式微调虽能更新权重,却可能成本高、难审计,也未必迅速适应新制度。

EpiEvolve提出了另一条路线:冻结暖启动阶段训练的Qwen3-14B-Base预测器,把适应能力放在外部记忆中。系统按州、HHS区域和全国保存预测案例;标签到达后,反思模块总结错误,战略蒸馏器将重复经验转为带前提、后果、支持次数和置信度的规则;漂移检测器再用异常序数误差或新变异株信号切换检索偏好。每周所有预测完成后才更新记忆,严格防止未来泄漏。

在2021年6月至2022年12月的81周、4050个州周样本上,EpiEvolve平均准确率0.629,超过静态PandemicLLM的0.561、流式微调的0.566及CDC集成的0.325。BA.5和BQ.1时期准确率为0.563和0.582,并把变异株切换后的恢复滞后从5周降至2周。消融表明反思、战略记忆和制度感知检索均关键,但研究仍受限于单一国家、单一疾病和LLM生成规则的可靠性。

深度分析

研究背景

疫情预测融合住院时间序列、政策文本、疫苗和基因组监测。COVID-19 Forecast Hub与PandemicLLM证明集成模型及LLM可处理多模态上下文,但多按静态监督范式训练评估。现实部署具有延迟标签和概念漂移,变异株更会使旧证据失效。

核心问题

第t周预测必须只用当时可见的xs,t和部署记忆Mt;整周预测完成后才公开Bt={(x,ŷ,y)}。模型需在不泄漏未来的条件下,从自身错误判断何时漂移、哪些历史案例仍相关,以及经验如何跨州迁移。

核心创新

  • ��冻结骨干、更新记忆:把适应从梯度转为提示上下文。
  • ��分层情景记忆:联合州、HHS区域和全国证据。
  • ��反思与战略蒸馏:由单次错误提炼可复用规则。
  • ��制度感知检索:同制度权重1,跨制度权重0.5。
  • ��双触发漂移检测:异常平均序数误差或新变异株字段。

方法详解

  • ��输入:每州近期病例与住院趋势、疫苗摘要、政策文本、主导变异株和区域背景。
  • ��预测:检索Et并匹配Lt,将案例和规则放入<MEMORY>、<RULES>,由冻结fθ输出五类序数趋势。
  • ��反馈:标签到达后生成一句反思ℓ和候选规则,写入情景记忆。
  • ��蒸馏:每K周或漂移时,在近期窗口归纳规则λ,并按经验精度c更新。
  • ��更新:漂移后提升新ρ权重、降级旧规则但不删除,进入下一周。

实验设计

暖启动截至2021-05-31;流式测试为2021-06-07至2022-12-19,共81周、50州、4050州周样本,涵盖Late-Alpha/Delta、BA.1、BA.2、BA.5、BQ.1。比较PandemicLLM、流式微调、Claude-ICL、CDC Forecast Hub集成、仅检索和反思记忆。指标包括准确率、序数标签MSE、恢复曲线与恢复滞后。

结果分析

EpiEvolve总准确率0.629,PandemicLLM为0.561,提升0.068;CDC仅0.325。各制度准确率为0.624、0.751、0.687、0.563、0.582。完整系统MSE为0.65、滞后2周;去反思为0.79和4周,去战略记忆为0.71和3周,去制度检索为0.73和3周。

应用场景

公共卫生部门可在每周住院预测中部署它,用延迟确诊或住院标签自动记录错误并生成下一周提示。前提是具有稳定的州级时间序列、政策与变异株监测,以及可审计的标签时间戳。类似机制也可服务流感、RSV、空气质量和需求预测。

局限与展望

证据来自美国COVID住院趋势,五个后验划分制度并非输入标签;外推到新疾病仍未知。LLM反思可能产生幻觉规则,记忆持续增长也带来提示长度和计算成本。未来应加入概率预测与校准、规则淘汰和人工审核,并在多国、多病原体及更剧烈漂移下进行前瞻验证。

通俗解读 非专业人士也能看懂

把预测系统想成一位每周值班的医院调度员。它先根据当周看到的病床变化、新闻和防疫措施,给50个州判断“住院会上升、稳定还是下降”。判断一旦交上去,本周就不能偷看答案;下周真实结果回来后,它才检查自己哪里错了。

普通调度员可能只凭旧经验,病毒一变就连续判断失误。EpiEvolve像一个分层档案柜:先找同州旧案例,再找同区域和全国相似案例;但如果现在是新变异株,它会更信新时期的记录。它还会把“某种信号出现时,我常把上升幅度估小”写成提醒卡。

这些提醒不会改造大脑本身,而是每周放在大脑面前。这样做便宜、容易追踪,也能避免用未来答案作弊。实验中,它的准确率为0.629,普通版本为0.561;新变异株出现后约2周恢复,而普通版本要5周。

简单解释 像给14岁少年讲一样

想象你在玩一款每周更新地图的预测游戏:你要给美国50个州猜住院人数趋势,是大降、小降、不变、小升还是大升。答案不会马上公布,等一周后才知道,所以你不能边玩边偷看答案。

普通机器人只会用开局学到的攻略。病毒变异后,旧攻略突然失灵,它可能连续五周输。EpiEvolve不改机器人本体,而是给它三个装备:一个记录每次猜测和结果的“经验背包”,一个把错误写成短提示的“复盘笔记”,还有一个寻找相似新情况的“搜索器”。

如果发现新变异株,搜索器会少看很久以前的案例,多看同一时期、相似地区的案例。多次出现的错误还会变成规则,例如“这种信号下不要低估上升”。

结果很亮眼:EpiEvolve准确率0.629,原始PandemicLLM是0.561,CDC集成只有0.325;变局后它2周恢复,原模型要5周。不过它仍可能记住错误经验,也只在美国COVID数据上测试。

术语表

Streaming forecasting(流式预测)

数据按时间逐批到达,模型先预测、后获得答案。它强调真实部署中的时间顺序。

论文用81周州级COVID住院趋势流评估。

Regime shift(制度/分布变迁)

数据规律因变异株、免疫或政策变化而改变。旧时期的预测关系可能失效。

测试划分为Delta至BQ.1五个时期。

Episodic memory(情景记忆)

保存具体历史预测、真实标签和反思的外部记忆。它不是更新模型权重。

按州、HHS区域和全国组织案例。

Strategic memory(战略记忆)

从重复错误中蒸馏出的带前提和置信度规则。规则可在新预测时作为提示。

规则λ含preconditions、consequent、c、n和制度标签。

Delayed feedback(延迟反馈)

标签在预测完成后才可见。严格批处理可防止同周信息泄漏。

Bt到达后才更新Mt+1。

开放问题 这项研究留下的未解疑问

  • 1 规则由LLM生成时,如何检测幻觉、冲突和错误累积,论文尚未给出系统安全保证。
  • 2 在流感、RSV、其他国家或缺少可靠变异株文本时,制度感知检索是否仍有效,需要跨域前瞻实验。

应用场景

近期应用

州级住院趋势预警

公共卫生分析团队可用既有PandemicLLM骨干接入延迟住院标签、政策文本和变异株监测。每周批量预测后自动反思并更新记忆,辅助资源调度,同时保留时间戳以便审计。

医院容量滚动预测

医院网络可按地区保存历史预测案例,在床位、病例和政策信号变化时检索相似经验。部署前需统一趋势标签和数据更新时间,预期收益是更快识别模型在新波次中的失准。

远期愿景

跨病原体自适应预警平台

将同一冻结骨干加记忆框架扩展至流感、RSV和新发病原体,形成可审计的长期经验库。主要障碍是标签稀疏、规则迁移风险和不同疾病机制差异。

原文摘要

Epidemic LLM forecasters are usually trained and evaluated as static supervised models, whereas operational pandemic forecasting is a streaming process in which labels arrive after predictions and disease regimes shift over time. We study this mismatch in weekly COVID-19 hospitalization trend forecasting across five variant regimes. We introduce EpiEvolve, a self-evolving agent that wraps an LLM forecaster trained on the warm-start period and keeps its weights fixed during streaming. EpiEvolve adapts by storing forecast outcomes in a hierarchical episodic memory, reflecting on delayed labels, retrieving cases relevant to the current regime, and distilling recurring errors into strategic rules. The resulting context lets the forecaster reuse its own past predictions and outcomes in later weeks while following a chronological protocol that prevents future leakage. On the streaming dataset, EpiEvolve reaches $0.629$ average accuracy, compared with $0.561$ for the static backbone and $0.325$ for the external CDC ensemble, and reduces recovery lag after regime shifts from $5$ to $2$ weeks. Ablations show that reflection, strategic memory, and regime-aware retrieval each contribute to the gains.

cs.AI cs.CL