Do Language Models Update their Forecasts with New Information?

TL;DR

引入EvolveCast框架评估大模型在新信息下的预测更新能力,发现模型普遍保守且不够合理。

cs.CL 🔴 高级 2025-09-28 56 次浏览
Zhangdie Yuan Zifeng Ding Andreas Vlachos
大模型 预测更新 信心校准 信念动态 信息融合

核心发现

方法论

本文提出EvolveCast框架,结合Metaculus社区预测数据与新闻检索,评估大模型在新信息出现时的预测调整。通过比较模型与人类预测的信心变化,采用方向一致性(MDA)、幅度误差(MSE、SMSPE)和校准变化(∆Brier)指标,分析模型的信念修正能力。模型在多种架构(Qwen、LLaMA)和参数规模(1.5B、7B、8B)上均表现出保守倾向,信心调整偏弱,未能充分反映新证据。

关键结果

  • 模型在信息更新后,信心变化的平均偏差仅为人类的30%-50%,显示出明显的保守性。具体而言,Qwen-7B模型的信心上调仅为+5%,而人类参考为+15%。模型的方向一致性(MDA)平均值约为0.25,远低于理想值0.5,表明其信念调整不够敏锐。校准指标显示模型在新信息后,信心偏向低估,∆Brier值为正,说明校准效果未改善或变差。

研究意义

该研究揭示了当前大模型在动态信念调整方面的不足,强调了信念更新机制的重要性。模型的保守性限制了其在实际决策中的适应性,影响其在政策制定、科学预测等领域的应用潜力。通过引入基于人类预测的参考标准,本文为未来构建更具信念动态的模型提供了评估框架,有助于推动模型在不确定环境中的可靠性提升。

技术贡献

提出EvolveCast评估框架,结合新闻检索与社区预测数据,系统分析模型信心更新的方向性、幅度和校准。引入基于信号的信念修正指标,突破传统静态准确性评价,强调模型应将新信息作为证据而非简单检索上下文。实验验证多架构模型在信念动态方面的局限,为未来设计更合理的知识整合机制提供理论基础。

新颖性

首次系统性评估大模型在新信息环境下的信念动态,提出结合人类预测作为参考的信心更新指标,突破传统静态预测评估范式。区别于以往只关注最终预测准确性的方法,强调模型应具备合理的信念调整能力,具有较强创新性。

局限性

  • 当前模型仍受预训练知识的强大锚定影响,难以充分利用外部新信息,表现出明显的保守性。新闻检索依赖语义相似度,可能受检索噪声影响,未能完全反映真实信号。模型在多轮信念调整中的表现仍不理想,未来需设计更有效的信念更新机制。

未来方向

未来可探索引入贝叶斯或粒子滤波等概率推理机制,增强模型对新信息的敏感性。结合强化学习优化信念调整策略,提升动态适应能力。同时,扩展多模态信息融合,增强模型在复杂环境中的信念演化能力。

AI 总览摘要

在人工智能快速发展的背景下,大型语言模型(LLMs)在知识回忆和推理任务中表现出色,但其在动态信念调整方面仍存在明显不足。传统评估多集中于静态预测准确性,忽视了模型应在新证据出现时合理修正预测的能力。本文提出EvolveCast框架,结合Metaculus社区预测数据与新闻检索技术,系统评估模型在新信息环境中的信念动态。通过比较模型与人类预测的信心变化,发现模型普遍表现出保守倾向,信心调整幅度远低于人类,且校准效果不佳。这一发现凸显了当前模型在信念修正机制上的局限,阻碍其在实际决策中的应用潜力。研究强调,未来应引入更复杂的概率推理机制,增强模型对外部信息的敏感性和合理性。该工作为推动模型在不确定环境中的信念演化提供了新的评估工具和理论基础,具有重要的学术价值和实际意义。未来方向包括结合贝叶斯推理、强化学习等技术,提升模型的动态适应能力,推动AI系统在政策、科学等领域的应用变革。

深度分析

研究背景

近年来,大模型在自然语言处理领域取得突破,代表性工作如GPT系列、LLaMA、Qwen等在知识回忆和推理任务中表现优异。然而,现有研究多关注静态任务,缺乏对模型在动态环境中信念调整能力的系统评估。随着应用场景逐渐扩展到政策预测、科学推断等,模型需要不断更新其信念以适应新信息。此前的工作如Forecast-Bench、OpenForecast等虽涉及概率预测,但多未深入分析模型信念的动态变化,特别是在面对后续新证据时的调整机制。

核心问题

核心问题在于大模型在面对新信息时表现出明显的保守性,未能合理调整预测概率。传统方法多将新信息视为检索上下文,而非证据,导致模型的信念更新偏弱,影响其在实际应用中的可靠性。这一问题源于模型预训练知识的强大锚定效应,以及缺乏有效的信念动态机制,限制了模型在不确定环境中的表现。

核心创新

本文提出EvolveCast框架,结合社区预测数据与新闻检索,系统评估模型信念的方向性、幅度和校准。创新点包括:1)引入人类预测作为参考标准,避免单纯以最终结果评判模型;2)利用语义相似度检索相关新闻,动态模拟信息更新场景;3)设计多指标(MDA、MSE、SMSPE、∆Brier)全面衡量信念调整的合理性。该方法突破了静态评估范式,强调模型应将新信息作为证据而非简单检索上下文。

方法详解

  • �� 设计基于Metaculus平台的二元预测问题,筛选出具有丰富社区预测和新闻关联的问题。• 利用新闻API检索与问题相关的新闻,筛选出时间点对应的关键信息。• 采用语义相似度(Reimers & Gurevych, 2019)排序新闻,确保信息相关性。• 让模型在两种条件下预测:无新信息(基础)与加入新信息(增强)。• 通过比较两次预测的信心变化(∆p)与人类参考变化(∆h),评估模型的信念修正能力。• 采用指标包括:方向一致性(MDA)、幅度误差(MSE、SMSPE)和校准变化(∆Brier)。• 分析模型在不同架构、参数规模和信息整合策略下的表现,验证其信念动态能力。

实验设计

实验选用Qwen和LLaMA系列模型,参数规模从1.5B到8B不等。通过在2023年10月后发布的问题进行评估,确保模型未提前获得未来信息。每个问题设定两个时点:T0(问题提出时)与T1(新闻发布时),模型在T0预测,T1后加入新闻信息。指标包括信心变化的方向性(MDA)、幅度(MSE、SMSPE)和校准(∆Brier)。此外,采用人类社区预测作为参考,确保评估的合理性。还进行多轮信息累积实验,检验模型在连续信息流中的信念调整能力。

结果分析

模型在新信息后,信心上调明显不足,例如Qwen-7B模型的信心仅上调+5%,而人类参考为+15%。方向一致性(MDA)平均值约0.25,远低于理想值0.5,显示信念调整不充分。校准指标(∆Brier)多为正,表明模型在新信息后信心偏低估。多架构模型表现出相似的保守性,且累积信息未显著改善信念调整效果,反映模型在动态信念修正方面的局限。

应用场景

该框架可用于评估未来AI系统在政策制定、科学预测等场景中的信念动态能力。通过改进模型的信念调整机制,有望提升其在不确定环境中的适应性和可靠性。未来,结合贝叶斯推理和强化学习,有望实现更合理的信念演化,推动AI在复杂决策中的应用。

局限与展望

模型仍受预训练知识的强大锚定影响,难以充分利用新信息。新闻检索依赖语义相似度,可能引入噪声,影响评估准确性。当前方法未考虑多轮信念调整的复杂性,未来需设计更有效的信念更新机制和多模态信息融合策略。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,平时根据食谱(模型的知识)来准备菜肴,但如果突然发现食材变了,比如蔬菜变得更新鲜,你会怎么调整?你可能会多放点盐或换个调味料。大模型也是这样,平时根据已有的知识做预测,但当收到新信息(比如新闻报道)时,它应该像你一样,调整自己的“菜谱”。但实际上,它常常像固执的厨师,不愿意改变原有的配方,或者只轻微调整。这个研究就像是在测试厨师(模型)是否能根据新食材(信息)合理调整菜肴(预测)。通过模拟新闻和社区预测,观察模型是否会像人一样,合理地修正自己的预测。结果显示,大模型大多很保守,调整幅度远低于人类,说明它们还不能很好地应对变化的环境。未来,我们希望让模型像灵活的厨师一样,能根据新证据快速、合理地调整自己的“菜谱”,让AI更聪明、更可靠。

简单解释 像给14岁少年讲一样

你知道吗,就像你在学校里做预测,比如猜明天会不会下雨。刚开始你可能觉得不会,但如果有人告诉你天气预报说可能会下雨,你会开始考虑调整你的想法,对吧?大模型也是一样,它们平时用自己学到的知识做预测,但当出现新消息,比如新闻报道,它们应该像你一样,调整自己的猜测。但是,研究发现这些大模型其实很固执,遇到新信息时,调整得很慢,或者根本不怎么变。这就像你听到天气预报说可能会下雨,但你还是坚持认为不会,结果可能会被淋湿。科学家用一种叫EvolveCast的方法,模拟模型在新信息出现时的反应,看看它们是否像人一样会合理调整。结果显示,大模型通常很保守,不愿意大幅改变自己的预测,说明它们还不能完全理解新证据的重要性。未来,科学家希望能让模型变得更聪明,能像你在天气变化时那样,灵活应对,做出更合理的预测。这样,AI在未来的决策和预测中会更靠谱,也更像人一样聪明!

原文摘要

Prior work has largely treated forecasting as a static task, failing to consider how forecasts and the confidence in them should evolve as new evidence emerges. To address this gap, we introduce EvolveCast, a framework for evaluating whether large language models revise their forecasts appropriately in response to new information. In particular, EvolveCast assesses whether LLMs update their forecasts when presented with information released after their training cutoff. We use human forecasters as a comparative reference to assess forecast updates and confidence calibration under new information. While LLMs demonstrate some responsiveness to new information, their updates are often inconsistent or overly conservative. We further find that both verbalized and logits-based confidence estimates remain far from the human reference standard. Across settings with a variety of LLMs, models tend to be conservative in updating their forecasts. These findings suggest that current approaches (e.g., RAG-based methods) for updating model knowledge are insufficient for probabilistic reasoning; models treat new information as retrieval context rather than evidence that shifts posterior probability. EvolveCast thus underscores the need for more robust mechanisms to incorporate external knowledge into belief dynamics.

cs.CL