A Comprehensive Evaluation of Large Language Models on Temporal Event Forecasting

TL;DR

论文以MidEast-TE-mini评测图、文及混合LLM预测,发现GPT-4抽取事件达72.6%,文本微调和RAG最有潜力。

cs.CL 🔴 高级 2024-07-16 29 次浏览
He Chang Chenchen Ye Zhulin Tao Jie Wu Zhengmao Yang Yunshan Ma Xianglin Huang Tat-Seng Chua
时间事件预测 大语言模型 时序知识图谱 检索增强生成 MidEast-TE-mini

核心发现

方法论

研究构建含新闻文本与结构化事件的MidEast-TE-mini,并比较graph-only、text-only和graph-text三类LLM方法。历史信息既可按查询主体、复杂事件和时间规则构造,也可由LLM筛选实体或由embedding相似度检索文本,再经摘要模块压缩后输入LLM预测缺失对象或关系。

关键结果

  • 数据集含12,542个原子事件、120个复杂事件、3,692篇文档及5,909个实体。GPT-4抽取与实体链接后的人工评估准确率为72.60%,高于MidEast-TE的55.56%和GDELT-TE的29.73%。
  • 论文报告:直接把原始文本加入LLM并未提升zero-shot外推;使用原始文本微调可显著改善性能。加入检索模块后,LLM能捕捉历史事件中的时序关系模式,但RAG仍明显受流行度偏差和长尾问题影响。
  • 误差分析显示本数据集错误中时间、关系、实体错误分别占16.67%、27.78%、55.56%;这说明实体链接与低频实体处理仍是预测可靠性的关键瓶颈。

研究意义

论文把长期分离的文本理解与时序知识图谱预测放入同一评测框架。它说明LLM的世界知识并不会自动转化为稳健的未来事件推理,结构化历史、文本上下文、检索策略和训练方式必须联合设计。该结论对冲突预警、外交分析和舆情监测具有现实价值,也为可解释、可追溯的预测系统提供了基准。

技术贡献

技术上,论文贡献了GPT-4驱动的多层CAMEO事件抽取与K-means辅助实体链接流程,并提出规则历史和检索历史两套上下文构造机制。检索历史分别在TKG中筛选相关实体、在新闻块上使用embedding检索,并在混合方法中用结构信息扩展文本召回。三种输入范式的统一比较揭示了RAG的收益与偏差。

新颖性

相较主要处理图结构的LLM事件预测工作,本文系统评估了原始新闻文本真正参与预测的方式,并构建了同时含图和文的高质量探索性基准。其新意不只是加入文本,而是将文本抽取质量、历史选择、摘要、检索和流行度偏差纳入同一分析框架。

局限性

  • MidEast-TE-mini只抽取120个时间跨度40—60天的复杂事件,且GPT-4抽取总体准确率仍为72.6%,错误会传播至后续预测。
  • 论文给出的内容主要聚焦数据集、方法与现象;所提供全文未包含各方法的具体Hit@K、MRR或完整预测表,因此不能据此声称某方法的数值领先幅度。
  • 数据来自中东新闻,跨地区、跨语言和跨领域泛化尚未验证。

未来方向

未来应改进事件抽取和实体链接,覆盖不同时间跨度及更多地区;同时研究去流行度检索、长尾校准、噪声鲁棒RAG和可解释证据链,并报告统一的Hit@K、MRR、校准度及成本指标。

AI 总览摘要

预测未来事件是冲突预警和国际关系分析的基础,但现有方法往往在两种信息之间取舍:时序知识图谱结构清晰,却丢失新闻中的细节;文本方法内容丰富,却难以稳定追踪实体、关系和时间。大语言模型看似拥有广泛常识,是否真正能够依据历史事件进行外推,仍缺乏系统证据。

Chang等人构建MidEast-TE-mini,将新闻文档、原子事件和复杂事件统一起来。数据包含12,542个原子事件、120个复杂事件和3,692篇文档,按时间划分训练、验证和测试集。作者比较graph-only、text-only及graph-text方法,并设计规则历史与检索历史:前者依据查询主体或复杂事件选择上下文,后者借助LLM筛选实体,或用embedding检索新闻,再通过摘要控制上下文长度。

结果呈现出重要但克制的结论。直接把原始文本塞入LLM并不能改善zero-shot外推;文本微调则能显著提升表现,RAG能够挖掘隐藏的时序关系,却仍受流行度偏差和长尾实体影响。GPT-4构建数据集的人工准确率为72.60%,高于MidEast-TE的55.56%和GDELT-TE的29.73%。因此,未来突破点不是简单扩大模型,而是提高抽取质量、检索公平性、长尾推理和证据可解释性。

深度分析

研究背景

时间事件预测通常把事件表示为四元组(s,r,o,t),并用Temporal Knowledge Graph建模历史演化。GDELT、ICEWS等图数据便于关系推理,ForecastQA和event script prediction则保留文本细节。GNN、Temporal Logical Rules和早期LLM方法已能处理部分结构模式,但文本噪声、幻觉、实体长尾及图文割裂仍未解决。

核心问题

给定历史图G<t或文档D<t及查询(s,r/o,t),系统需预测缺失对象或关系。难点包括:新闻一文多事件、事件抽取不准、上下文超长、未来外推而非记忆,以及低频或首次出现实体缺少统计支持。论文特别考察输入形式、RAG和流行度偏差。

核心创新

  • ��构建MidEast-TE-mini:从MidEast-TE抽取120个时间跨度40—60天的复杂事件。•用GPT-4按CAMEO三层层级抽取事件,并用K-means分组后进行实体链接。•统一比较图、文、图文三类方法。•提出rule-based history与retrieved history,并研究LLM摘要、embedding检索和结构引导文本召回。

方法详解

  • ��事件定义:原子事件为(s,r,o,t,c),同一时间形成Gt,c表示复杂事件类型。•数据处理:新闻切为约150 token片段,按CAMEO层级逐步抽取;实体先K-means聚类,再由GPT-4链接。•图历史:保留查询主体的全局事件及复杂事件近两日局部事件,或让LLM从候选实体中筛选。•文本历史:依据相关事件找文档,或切块后用embedding按主体检索,再按时间排序、过滤和摘要。•预测:将历史事件、摘要、查询和候选选项置于专门prompt中,由LLM选择缺失对象。

实验设计

数据按时间切分:训练8,999事件、88个复杂事件、2,647篇文档;验证1,777、19、473;测试1,766、18、572。总计实体5,909、关系267。比较graph-only、text-only、mixed及规则/检索历史,并进行人工抽取评估。提供文本显示的主要指标是抽取准确率,而非完整预测分数。

结果分析

GPT-4抽取的MidEast-TE-mini准确率72.60%,超过MidEast-TE的55.56%和GDELT-TE的29.73%。错误中实体占55.56%,关系占27.78%,时间占16.67%。方法层面,原始文本直接加入zero-shot没有增益;微调有效;RAG可发现时序关系,但未消除流行度偏差和长尾缺陷。

应用场景

可用于地区冲突预警、外交关系监测、新闻事件演化追踪和风险情报整理。实际部署需保留原文证据、进行人工复核,并监控抽取错误、来源偏见和低频实体召回;否则模型可能把新闻热度误当作未来概率。

局限与展望

数据规模和范围有限,仅覆盖120个中东复杂事件,且事件跨度被限制在40—60天。GPT-4抽取准确率72.6%仍会造成标签噪声;实体错误尤其突出。提供文本未给出完整预测指标、成本和显著性检验,因此无法量化各方法的领先程度。未来需扩大地区与语言,采用去偏检索、噪声鲁棒训练、校准评估和可解释证据链。

通俗解读 非专业人士也能看懂

把系统想成一位调查记者,任务是猜新闻故事下一步会发生什么。记者手里有两种材料:一份像表格的事件清单,记录谁对谁做了什么、什么时候发生;另一份是完整新闻,包含原因、背景和细节。论文先让GPT-4把新闻整理成事件清单,再比较三种工作方式:只看清单,只看新闻,或两者一起看。

记者还可以自己按规则翻看最近材料,也可以先找出与当前人物最相关的旧报道。这就是两种历史选择方法。检索后,系统还会把长文章压缩成摘要,避免一次读太多内容。实验发现,单纯把所有原文堆给模型并不会让它更会预测;经过训练,模型才能更好利用文字。检索能找到隐藏的事件联系,但热门人物仍更容易被选中。

这项研究的价值在于提醒我们:会读文章不等于会预测未来。就像记者如果只关注头条人物,就可能忽略关键但不出名的小角色。数据集有12,542个事件,GPT-4整理结果的准确率为72.6%,说明材料质量本身仍需改进。

简单解释 像给14岁少年讲一样

想象你在玩一个“预测下一关剧情”的游戏。每一关都有谁和谁发生了什么、事情发生在什么时候,还有一大堆新闻式剧情。你的任务是根据前面的剧情,猜下一个空格里会出现谁或发生什么。研究人员让大语言模型来玩这个游戏,但先用GPT-4把新闻整理成事件卡片。

模型有三种看法:只看事件卡片,只看新闻,或者两种一起看。它还可以自己挑最相关的旧卡片,或从新闻库里搜索相似内容,再把长文章缩成短摘要。听起来像开挂,对吧?但结果很有意思:把所有新闻直接塞进去并不会自动变聪明;模型经过训练后,才更会利用文字。搜索历史能帮助它发现事件之间的时间联系。

不过模型也有“只关注明星角色”的问题。热门国家和人物经常出现,所以更容易被猜中;冷门角色就像游戏里的隐藏NPC,常被忽略。数据整理本身也不完美:总体准确率是72.6%,很多错误来自认错实体。未来要让模型不仅会猜,还要说明证据来自哪篇新闻。

术语表

Temporal Event Forecasting (时间事件预测)

根据截至时刻t的历史事件,预测未来缺失的对象、关系或事件。它关注时间顺序与关系演化,而非静态分类。

论文的核心任务。

Temporal Knowledge Graph (时序知识图谱)

用带时间的结构化事件表示知识;本文原子事件为(s,r,o,t,c)。它便于追踪主体、关系、对象和复杂事件。

graph-only和mixed方法的结构输入。

Retrieval-Augmented Generation, RAG (检索增强生成)

先从历史图或文档中检索相关证据,再让生成模型基于证据回答。检索可减少无关上下文,但也可能放大热门实体偏差。

论文的retrieved history方法。

CAMEO ontology (CAMEO本体)

用于编码国际事件关系的层级事件类型体系。论文按三层结构逐级抽取,以降低超过200类事件同时放入提示词的成本。

GPT-4事件抽取。

Complex Event (复杂事件)

由多个相关原子事件组成、跨越较长时间并涉及多个实体的事件过程。中东冲突是论文中的典型例子。

数据聚类和局部历史构造。

Popularity Bias (流行度偏差)

模型倾向预测频繁出现的实体或关系,而忽略低频对象。其来源包括训练分布、检索频率和历史图连接度。

论文重点分析的失败模式。

开放问题 这项研究留下的未解疑问

  • 1 论文没有在提供的文本中给出各方法完整Hit@K、MRR、显著性检验或推理成本,因此尚不能精确判断不同LLM方案的统计优势。
  • 2 GPT-4抽取错误会影响标签和检索,但如何联合训练抽取器与预测器、并对不确定性进行校准,仍未解决。
  • 3 中东单一区域和英语新闻能否推广到其他地区、语言及突发事件类型,需要更大规模、多源数据验证。

应用场景

近期应用

冲突新闻监测

情报分析人员可用MidEast-TE式事件抽取把新闻转成带时间的事件链,再用RAG检索相关历史并生成候选预警。部署时应保留原文证据、设人工审核,并单独评估长尾实体。

外交关系追踪

政府或媒体研究团队可按国家、组织和关系检索历史互动,识别声明、援助、军事行动等模式。该方法适合作为线索生成器,而不应替代专家判断或直接触发决策。

远期愿景

可解释全球风险雷达

若扩大到多语言、多地区并加入去偏检索、概率校准和证据链,系统可持续监测跨国危机演化。主要障碍是数据许可、事件定义一致性、抽取噪声和对抗性新闻。

原文摘要

Recently, Large Language Models (LLMs) have demonstrated great potential in various data mining tasks, such as knowledge question answering, mathematical reasoning, and commonsense reasoning. However, the reasoning capability of LLMs on temporal event forecasting has been under-explored. To systematically investigate their abilities in temporal event forecasting, we conduct a comprehensive evaluation of LLM-based methods for temporal event forecasting. Due to the lack of a high-quality dataset that involves both graph and textual data, we first construct a benchmark dataset, named MidEast-TE-mini. Based on this dataset, we design a series of baseline methods, characterized by various input formats and retrieval augmented generation (RAG) modules. From extensive experiments, we find that directly integrating raw texts into the input of LLMs does not enhance zero-shot extrapolation performance. In contrast, fine-tuning LLMs with raw texts can significantly improve performance. Additionally, LLMs enhanced with retrieval modules can effectively capture temporal relational patterns hidden in historical events. However, issues such as popularity bias and the long-tail problem persist in LLMs, particularly in the retrieval-augmented generation (RAG) method. These findings not only deepen our understanding of LLM-based event forecasting methods but also highlight several promising research directions. We consider that this comprehensive evaluation, along with the identified research opportunities, will significantly contribute to future research on temporal event forecasting through LLMs.

cs.CL cs.IR