Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives
提出NCP-Bench,评估LLM在长时序一致性中的表现,GPT-5.2仅达42%存活率。
核心发现
方法论
本文提出Narrative Commitment Preservation(NCP)框架,结合100个电影梗概构建NCP-Bench,利用自动化检查确保故事轨迹、承诺和事实的一致性。通过结构化的故事规格,包括轨迹、承诺和初始事实,结合多轮对话模拟,评估不同LLM模型在长时间交互中的表现。采用自动冲突检测、事实更新和承诺验证机制,确保每轮响应的逻辑一致性。实验中引入对抗性干预,测试模型在面对用户突发行为时的稳健性。
关键结果
- 最优模型GPT-5.2在20轮后存活率仅达42%,随着交互深入,存活率迅速下降,接近零。模型在100轮内满足所有承诺的极少,事实冲突率在40%至68%之间,显示出当前LLM在长时一致性方面的巨大差距。
- 不同模型在应对对抗干预时表现差异显著,强模型虽具备较高语言质量,但在保持逻辑一致性方面仍存在明显缺陷。实验揭示了模型在复杂叙事环境中的脆弱性。
- 通过结构化的评估框架,明确了长时一致性是衡量交互叙事系统核心能力的关键指标,为未来模型优化提供了量化标准。
研究意义
该研究强调了长时逻辑一致性在交互叙事中的核心地位,揭示了当前LLM在维护故事完整性方面的不足。为未来构建更可靠的叙事引擎提供了评估工具和理论基础,有助推动AI在游戏、虚拟角色和教育等领域的应用创新。研究突破了传统仅关注语言流畅的局限,强调逻辑和承诺的持续维护,具有重要的学术和工业价值。
技术贡献
提出基于结构化事实库和承诺验证的NCP框架,结合自动化检测机制实现故事轨迹的持续监控。引入100个多样化电影梗概作为评估基准,推动长时一致性研究的标准化。通过对多模型的系统评测,揭示模型在面对对抗性干预时的局限性,为未来模型设计提供改进方向。技术创新在于将长时逻辑约束融入LLM交互,突破了传统静态生成的限制。
新颖性
首次系统性提出Narrative Commitment Preservation(NCP)概念,结合自动化检测和多轮对话评估长时一致性。不同于以往偏重语言质量的评估方法,本研究强调逻辑连贯性和承诺维护,建立了可量化的评估体系。创新点在于将电影梗概转化为结构化的交互环境,提供了可复现的测试平台,推动交互叙事研究的标准化。
局限性
- 模型在面对极端对抗干预时仍表现出明显脆弱性,说明当前技术难以应对复杂的用户行为变化。
- 评估框架依赖预定义的故事轨迹和承诺,可能限制模型的创造性表达,未来需平衡逻辑一致性与自由度。
- 实验主要集中在电影梗概基础上,实际应用中场景多样性和复杂度更高,仍需扩展验证。
未来方向
未来将探索更强的模型架构和训练策略,以提升长时一致性。引入多模态信息和用户行为建模,增强系统的鲁棒性。同时,推动构建更丰富的交互场景和多样化的故事规格,完善评估指标,推动交互叙事的实际应用落地。
AI 总览摘要
随着大型语言模型(LLMs)在交互叙事中的应用逐渐普及,确保故事在长时间交互中的逻辑一致性成为关键挑战。现有模型虽能生成流畅文本,但在面对用户突发行为时,常出现逻辑冲突或故事偏离原有轨迹的问题。为此,本文提出了Narrative Commitment Preservation(NCP)框架,旨在量化和评估模型在长时序中的承诺维护能力。
通过构建由100个电影梗概组成的NCP-Bench,研究团队设计了结构化的故事规格,包括轨迹、承诺和初始事实,结合自动化检测机制,实时监控模型响应的逻辑一致性。实验结果显示,即使是最先进的GPT-5.2模型,在20轮交互后存活率仅为42%,且随着交互深入,模型在保持故事完整性方面的表现迅速下降,事实冲突率高达68%。这些数据揭示了当前LLMs在长时序交互中的脆弱性,强调了逻辑一致性的重要性。
该研究不仅提供了一个标准化的评估平台,也推动了长时一致性理论的发展,为未来构建更可靠、具有逻辑保障的交互叙事系统奠定基础。尽管取得了显著进展,但模型在面对复杂用户行为时仍存在不足,未来需结合多模态信息和更复杂的故事规格,提升系统的鲁棒性和创造性。整体而言,这项工作为AI在游戏、虚拟角色和教育等领域的应用提供了新的技术路径和理论支持,具有深远的学术和工业价值。
深度分析
研究背景
交互叙事作为AI研究的重要方向,旨在实现具有逻辑一致性和故事完整性的多轮人机交互。早期工作如Riedl和Bulitko(2013)提出的故事生成模型,强调故事的结构化表达,但缺乏对长时序逻辑的持续维护。近年来,诸如Teleki等(2025)和Wu等(2025)引入的LLMs推动了故事生成的流畅性,但在长时间交互中,故事偏离和逻辑冲突频繁出现。传统评估多关注文本质量和用户体验,缺乏对逻辑一致性的量化衡量。随着模型规模的扩大,如何确保故事在多轮交互中的连续性成为核心难题。
核心问题
核心问题在于,当前LLMs在长时间交互中难以保持故事的逻辑一致性和承诺的持续性。用户的自由行为可能引发故事偏离原有轨迹,模型难以在满足用户需求的同时,遵守既定的世界规则和剧情承诺。这一矛盾导致故事的可信度和沉浸感下降,严重制约了交互叙事的实际应用。解决这一问题需要引入结构化的逻辑约束和自动化检测机制,以确保故事的连续性和一致性。
核心创新
本研究的创新点在于提出Narrative Commitment Preservation(NCP)框架,结合自动化检测和结构化的故事规格,实现对长时序故事的逻辑监控。首次将电影梗概转化为结构化的交互环境,设计了轨迹、承诺和事实三大要素,系统评估模型在多轮交互中的表现。引入对抗性干预测试,验证模型在面对突发用户行为时的稳健性。该方法突破了传统仅关注文本质量的局限,为长时一致性提供了量化指标和系统评估平台。
方法详解
- �� 构建数据集:采集并清洗100个电影梗概,确保多样性和故事完整性。
- �� 设计结构化规格:定义轨迹、承诺和事实,形成故事规格。
- �� 自动化检测:开发冲突检测、事实更新和承诺验证机制,实时监控模型响应。
- �� 交互模拟:模拟多轮对话,结合对抗性干预,测试模型在极端情境下的表现。
- �� 评估指标:统计存活率、冲突率、承诺满足率,量化模型一致性。
实验设计
采用多种前沿LLMs(如GPT-5.2、DeepSeek-V3.2等)在NCP-Bench上进行评测,设置最大100轮交互,采用温度0.6、top-p 0.95的解码参数。引入对抗性干预,模拟用户突发行为,评估模型在不同场景下的表现。通过自动冲突检测和承诺验证,统计存活率、冲突率和任务完成情况。实验还包括模型消融分析,验证结构化规格和检测机制的效果。
结果分析
GPT-5.2在20轮后存活率仅为42%,随着轮次增加,存活率迅速下降,接近零。模型在100轮内满足所有承诺的比例极低,事实冲突频发,显示出模型在长时序中的逻辑保持能力不足。不同模型表现差异明显,强模型虽有较高语言质量,但在逻辑一致性方面仍存在明显缺陷。实验结果强调了长时一致性的重要性和当前模型的不足,为未来改进提供了明确方向。
应用场景
该框架适用于游戏设计、虚拟角色、教育培训等场景,能提升交互系统的逻辑可靠性。通过量化评估指标,帮助开发者优化模型,确保故事连贯性和逻辑一致性,增强用户沉浸感。未来,结合多模态信息和个性化用户建模,将推动交互叙事向更智能、更可信的方向发展。
局限与展望
模型在面对极端对抗干预时仍表现脆弱,说明技术尚未成熟。评估依赖预定义故事规格,可能限制创造性表达。实验主要基于电影梗概,实际应用场景更复杂,需进一步验证。未来需解决模型泛化能力和多模态信息融合的问题,以实现更广泛的应用。
通俗解读 非专业人士也能看懂
想象你在玩一个故事接龙游戏,你需要不断讲故事,同时还要遵守一些规则,比如不能突然让角色变成超人或说谎。每次你讲完一段,别人会检查你的故事是否合理,是否符合之前的承诺。现在,假设你用一个超级智能的机器人帮你讲故事,但这个机器人有点不靠谱,经常会忘记之前说过的话,或者突然改变故事走向。为了让故事连贯,你需要给机器人设定一些规则,让它每次讲完后都检查自己有没有违反承诺。这个过程就像在做一个长长的故事拼图,要保证每一块都拼得合理,不能乱掉。研究人员用这种方法,设计了一个测试平台,让机器人在讲故事时,能坚持住故事的逻辑,避免出现矛盾。结果显示,即使是最聪明的机器人,也只能坚持20轮左右,之后就会出现很多逻辑错误。这就像你和朋友玩接龙,越玩越容易出错。这个研究帮助我们理解,未来让机器人讲故事变得更靠谱,还需要很多改进。
原文摘要
The rapid advancement of Large Language Models (LLMs) is revolutionizing AI for Games by enabling open-ended and fluid interactive storytelling. However, existing research has largely overlooked the critical challenge of maintaining long-horizon logical consistency and narrative integrity against unconstrained user interventions. To address this, we formulate this challenge as Narrative Commitment Preservation (NCP), and take interactive narrative as our testbed. We introduce NCP-Bench, a benchmark of 100 narrative environments derived from movie synopses. Each environment includes a structured narrative specification (trajectory, commitments, and initial facts) that we can automatically check throughout the interaction between the player agent and the narrator agent. Experiments across state-of-the-art LLMs reveal a substantial long-horizon consistency gap: high linguistic quality does not guarantee commitment preservation; even strong models frequently generate logically conflicting content under adversarial interventions, with the best-performing model (GPT-5.2) achieving only 42% survival rate after 20 turns and fact conflict rates ranging from 40% to 68% across models, and only isolated runs satisfying all achievement commitments within the 100-turn limit.