Advancing Event Forecasting through Massive Training of Large Language Models: Challenges, Solutions, and Broader Impacts

TL;DR

论文提出以RLVR、反事实事件与多源数据训练预测LLM;R1-14B在Polymarket上由Brier 0.214降至0.197。

cs.LG 🔴 高级 2025-07-26 36 次浏览
Sang-Woo Lee Sohee Yang Donghyun Kwak Noah Y. Siegel
事件预测 大语言模型 强化学习 预测市场 校准

核心发现

方法论

论文是立场与路线图,而非新模型实验。框架结合时间完整的RAG、动态基准、RLVR、假设事件贝叶斯网络、反事实数据和辅助奖励,并扩展市场、公共数据库与网页爬取数据,以训练和评估面向未来事件的概率预测LLM。

关键结果

  • ForecastBench显示,GPT-4o的Brier分数为0.133、Claude-3.5-Sonnet为0.122,优于早期GPT-3.5-Turbo与Llama-2-70B的0.2以上,但仍高于Superforecaster AI的0.096。一般公众预测中位数为0.121。
  • Turtel等在Polymarket数据上训练R1-14B,使原始Brier分数从0.214改善至0.197,接近OpenAI o1;数据增强还降低ECE与算法方差,并在回测中观察到潜在交易收益。
  • 论文指出静态ForecastQA、AutoCastQA和AutoCast++易受污染,动态基准更可靠;检索必须限制在问题日期以前,RetroSearch平均提供每题20,000篇历史文档。

研究意义

研究把事件预测从提示工程问题重新定义为大规模训练、数据工程和评估完整性问题。它说明通用模型能力、推理模型、工具使用与强化学习可能共同缩小人与机器预测差距,同时提醒研究者区分记忆、信息泄漏与真正的时间外推能力。

技术贡献

核心贡献是系统化提出三类训练障碍:结果噪声与相似样本稀疏、模型知识截止造成可用数据减少、二元结果奖励过于容易。对应方案包括用假设事件贝叶斯网络分析标签分配,用低回忆事件和反事实事件强化检索推理,并用一致性检查及相关子问题提供辅助奖励。

新颖性

论文并非提出已验证的新算法,而是提出面向规模化训练的研究议程。其新意在于把预测市场、GDP等结构化数据和新闻爬取统一为训练基础设施,并将知识截止、奖励投机和概率一致性作为预测LLM的专门设计对象。

局限性

  • 论文主要是立场论文,未报告自身端到端模型、统一数据集或新的显著性检验,因此方案的实际收益仍需实验验证。
  • 预测结果具有固有随机性,选举等事件样本稀疏;市场偏差、网页时间泄漏、模型校准失真和反事实数据质量都可能误导训练。
  • 预测系统可能影响市场并产生自我实现或恶意操纵效应,盈利回测也不能证明现实交易中的长期稳健性。

未来方向

未来应建立持续更新、严格时间隔离的多源数据集,比较二元化与直接连续预测,训练一致性和校准目标,并系统测试辅助奖励、反事实生成、检索策略及RLVR的消融效果,同时研究安全接口与攻击防护。

AI 总览摘要

未来事件预测要求模型在明确的历史时点上,判断某件事是否会发生及其概率。早期研究常因样本过小、知识截止日期错误和搜索结果混入事后信息而高估LLM能力。论文认为,动态基准、推理模型和工具使用已使重新推进这一方向成为可能。

作者提出以大规模训练为核心的路线:使用时间受限RAG获取证据,以RLVR根据真实结果优化概率;用假设事件贝叶斯网络处理噪声与样本稀疏;用低回忆和反事实事件绕过知识截止;用概率一致性、相关子问题等辅助奖励防止模型只追逐容易的二元结果。数据则来自Polymarket、Metaculus等市场,GDP和经济指标等公共数据库,以及新闻网页爬取。

结果主要来自既有研究:ForecastBench中GPT-4o和Claude-3.5-Sonnet的Brier分数分别为0.133和0.122,Superforecaster AI为0.096;R1-14B经Polymarket RLVR训练后由0.214降至0.197。论文同时强调,这不是“预言机器”方案,仍须面对校准、泄漏、市场反馈、攻击与社会责任问题。

深度分析

研究背景

事件预测从ForecastQA、AutoCastQA、AutoCast++等静态数据集发展到ForecastBench和Metaculus AI Benchmarking等动态评测。RAG、集成、o1/o3推理模型和Deep Research提升了信息处理能力;但静态数据易被预训练污染,网页检索还可能泄漏解析后的结果。

核心问题

目标是在问题日期可用的信息下输出概率,并在解析日期用Brier、log score和ECE评价。困难包括结果本身不确定、相似事件稀疏、模型内部已记住历史答案、奖励只需猜中即可获得,以及多问题概率不一致。

核心创新

第一,提出假设事件贝叶斯网络,为不同标签分配和中间奖励提供理论视角。第二,利用模型记忆较弱的比较事件,并生成反事实事件,使训练更依赖检索和推理。第三,引入一致性与子问题辅助奖励。第四,整合市场、公共和爬取数据,形成快速迭代的动态训练评估循环。

方法详解

  • �� 输入:带问题日期、解析日期和二元或连续目标的未来事件。
  • �� 检索:RAG生成查询、搜索历史文档并重排;RetroSearch或Exa.ai限制未来信息泄漏。
  • �� 预测:LLM输出概率,可通过多提示、多模型集成降低方差。
  • �� 训练:用真实解析结果执行RLVR;用贝叶斯网络刻画隐变量和相关事件。
  • �� 增强:加入低回忆比较事件、反事实样本、概率否定/蕴含一致性及相关子问题。
  • �� 评估:动态滚动测试Brier、log score、ECE,并比较市场与专家集体预测。

实验设计

论文综合ForecastBench、Metaculus AI Benchmarking及Turtel等研究。关键数据包括约200题的人类与专家比较、约300题的Metaculus挑战和约100题的专家集体评测。指标为Brier分数、log score和ECE;Polymarket用于RLVR训练、增强和虚拟交易回测。

结果分析

GPT-4o达到0.133,Claude-3.5-Sonnet达到0.122,均明显优于早期模型超过0.2的水平,但尚未达到0.096的Superforecaster AI。公众预测中位数为0.121。R1-14B经训练由0.214降至0.197,数据增强进一步改善ECE并降低方差;这些结果支持规模化训练,但不是本文自身的新实验。

应用场景

潜在场景包括政策和风险预警、AI辅助交易、未来情景模拟,以及让通用智能体和AI科学家具备概率推理。实际部署需时间隔离检索、可解释校准、风险上限和人工复核;市场预测还必须防止模型交易造成反馈循环。

局限与展望

论文缺少统一的新模型和完整消融,许多证据来自相关工作。市场数据覆盖范围有限且可能带有参与者偏差;公共与网页数据的时间戳、版权和质量也不稳定。未来应验证反事实标签、辅助奖励和连续预测,并研究自我实现预测、恶意操纵、隐私与系统计算成本。

通俗解读 非专业人士也能看懂

把预测LLM想成准备天气预报的团队。它先只能查看当天以前的报纸和记录,不能偷看答案;然后从市场、经济表格和新闻中寻找线索。一次预测像猜明天是否下雨,但真正的训练不是只奖励“猜中”,还要检查它有没有把相关线索看全、前后说法是否矛盾。

现实中,很多事情只发生一次,例如一次选举或一次发射,所以可参考的旧案例很少,而且结果本来就不是确定的。论文建议制造“如果当时发生另一种情况”的练习题,或选择模型不太记得答案的比较题,让团队学习判断方法,而不是背答案。

团队表现用概率误差衡量:猜80%却失败,比猜55%更严重。研究显示,较新的模型已经比普通个人更接近专家群体,但仍不能保证长期准确。它适合辅助判断,不应被当作不会犯错的预言家。

简单解释 像给14岁少年讲一样

想象你要预测学校下周会不会停课。你不能只凭感觉,还要看天气、通知、历史安排和交通情况,而且只能使用今天以前知道的消息。真正的AI预测也是这样:它要回答“事件发生的概率是多少”,不是简单说一定会或一定不会。

难点在于,很多大事很少重复。总统选举或火箭发射可能几年才有一次,所以练习材料不够;有些答案模型早就从训练资料里见过,测试就像考试前偷看答案。论文还担心模型只学会“押一个容易的答案”,却没有认真查资料。

作者的办法像设计更聪明的训练游戏:加入假设情景,例如“如果另一队获胜会怎样”,检查前后答案是否互相打架,并让模型回答相关小问题。数据来源也不只是一种,包括预测市场、经济数据和新闻。

数字很有意思:GPT-4o的Brier分数是0.133,Claude-3.5-Sonnet是0.122;经过训练,R1-14B从0.214改善到0.197。分数越低越好,但它们仍不是完美预言家。未来AI可以帮助规划和预警,不过人类仍要检查证据、风险和可能的恶意影响。

术语表

Event forecasting(事件预测)

根据某个时间点以前的信息,估计未来事件发生的概率。它关注概率质量,而非只追求答对或答错。

论文的核心任务,主要讨论二元事件,也涉及连续和多选预测。

Brier score(布里尔分数)

计算预测概率f与实际结果o之间的平方误差,即(f−o)^2;越低越好。50%恒定预测的基准为0.25。

ForecastBench和Polymarket实验的主要指标。

RLVR(可验证奖励强化学习)

用可由真实结果自动核验的奖励训练模型。事件解析后,可依据概率与结果的误差更新模型。

Turtel等将其用于Polymarket数据,改善R1-14B。

Knowledge cut-off(知识截止)

模型训练资料覆盖的最后时间。若评测事件在此之前已发生,模型可能记忆答案而非预测。

论文要求问题日期、解析日期和模型知识截止严格区分。

Dynamic benchmark(动态基准)

持续加入尚未解析的问题,并在未来结果确定后评分。它比固定历史数据更能减少污染。

ForecastBench和Metaculus挑战采用的评估思想。

ECE(期望校准误差)

衡量模型声明的概率与实际发生频率之间的差距。校准良好意味着报70%的事件约有70%发生。

用于分析数据增强和训练是否改善概率可靠性。

开放问题 这项研究留下的未解疑问

  • 1 如何为具有相关性、稀疏性和隐藏原因的事件构造可靠贝叶斯网络,并证明辅助奖励不会让模型优化代理目标,仍是开放问题。
  • 2 市场、公共数据和网页数据的覆盖、版权、时间戳与偏差如何统一治理,尚无成熟的大规模标准。
  • 3 模型预测公开后会改变被预测事件本身;如何测量自我实现、市场操纵和恶意攻击风险,需要长期在线研究。

应用场景

近期应用

政策与风险预警

研究机构可用动态市场、经济指标和历史新闻构建时间隔离的预测面板,辅助识别供应链、宏观经济或公共风险。系统应显示概率、证据时间和校准历史,并由专家复核。

预测市场分析

交易研究者可将LLM概率与Polymarket或Metaculus价格比较,发现信息差并进行纸面回测。使用前必须控制交易成本、流动性、数据泄漏和模型自我影响,不能把回测收益视为保证。

远期愿景

预测型通用智能体

未来智能体可把检索、程序化回归、情景模拟和概率校准结合起来,为科学规划、资源配置和AI科学家提供可更新的预测。关键障碍是可靠性、责任归属、隐私与对社会系统的反馈影响。

原文摘要

Many recent papers have studied the development of superforecaster-level event forecasting LLMs. While methodological problems with early studies cast doubt on the use of LLMs for event forecasting, recent studies with improved evaluation methods have shown that state-of-the-art LLMs are gradually reaching superforecaster-level performance, and reinforcement learning has also been reported to improve future forecasting. Additionally, the unprecedented success of recent reasoning models and Deep Research-style models suggests that technology capable of greatly improving forecasting performance has been developed. Therefore, based on these positive recent trends, we argue that the time is ripe for research on large-scale training of superforecaster-level event forecasting LLMs. We discuss two key research directions: training methods and data acquisition. For training, we first introduce three difficulties of LLM-based event forecasting training: noisiness-sparsity, knowledge cut-off, and simple reward structure problems. Then, we present related ideas to mitigate these problems: hypothetical event Bayesian networks, utilizing poorly-recalled and counterfactual events, and auxiliary reward signals. For data, we propose aggressive use of market, public, and crawling datasets to enable large-scale training and evaluation. Finally, we explain how these technical advances could enable AI to provide predictive intelligence to society in broader areas. This position paper presents promising specific paths and considerations for getting closer to superforecaster-level AI technology, aiming to call for researchers' interest in these directions.

cs.LG cs.AI cs.CL