The Horizon Gap: Planning, Memory, Execution, Training, and Evaluation for Long-Horizon LLM Agents

TL;DR

提出“视距差距”概念,分析长时任务中LLM的规划、记忆、执行等问题,基于1547篇论文总结解决方案。

cs.CL 🔴 高级 2026-08-07 25 次浏览
Mingguang Chen Licheng Wang Bo Qu
长时任务 大语言模型 规划 记忆 评估

核心发现

方法论

通过系统性文献综述,分析长时任务中LLM的表现,提出六大研究方向:规划、记忆、执行、训练、评估和基础理论。采用八线程种子检索和两阶段过滤构建1547篇论文的语料库。

关键结果

  • 结果1:发现单步信号在长时任务中失效,需通过过程奖励模型和轨迹级诊断生成密集信号。
  • 结果2:提出三轴区分:长时任务(任务属性)、长上下文(模型属性)、长时记忆(系统属性),并验证其独立性。
  • 结果3:识别两大测量难题:模型与框架能力分解、训练与评估信号的相关偏差。

研究意义

该研究首次系统性定义并分析了长时任务中LLM的主要瓶颈,提出了视距差距这一关键概念,为未来的长时任务研究提供了清晰的方向和框架。

技术贡献

提出六类任务生命周期的分类框架,并交叉分析视距的承载方式(上下文内、任务内超上下文、跨任务持久)。强调诊断性文献的重要性,将其作为一等公民贯穿研究。

新颖性

首次系统性区分长时任务、长上下文和长时记忆,提出视距差距作为核心瓶颈,填补了长时任务领域的理论和实践空白。

局限性

  • 局限1:语料库构建基于规则和单一标注者,可能存在分类偏差。
  • 局限2:未涵盖非英文文献和工业未发表工作,可能低估实际进展。
  • 局限3:实验结果基于文献综述,缺乏直接实验验证。

未来方向

未来可探索更精确的测量方法,如分解模型与框架能力,改进训练与评估信号的独立性,并研究长时任务可靠性的通用预测理论。

AI 总览摘要

当前大语言模型(LLM)在单步推理任务中表现卓越,但在长时任务中暴露出显著问题,如目标漂移、记忆丢失和未完成任务的错误完成。这种能力差距被称为“视距差距”。

本文通过系统性综述1547篇论文,提出了长时任务的六大研究方向:规划、记忆、执行、训练、评估和基础理论,并进一步区分了任务属性(长时任务)、模型属性(长上下文)和系统属性(长时记忆)。研究发现,单步信号在长时任务中逐渐失效,需通过过程奖励模型和轨迹级诊断生成密集信号。

该研究不仅提出了视距差距的理论框架,还明确了未来研究的关键方向,包括改进测量方法、分解模型与框架能力,以及研究长时任务可靠性的预测理论,为长时任务领域奠定了重要基础。

深度分析

研究背景

近年来,大语言模型(LLM)在单步推理任务中取得了显著进展,如代码生成和复杂问题求解。然而,长时任务(如多小时的软件工程任务)暴露出模型在规划、记忆和执行上的不足。

核心问题

核心问题在于LLM在长时任务中失去一致性,表现为目标漂移、早期决策遗忘和错误完成任务。这种能力差距被定义为“视距差距”。

核心创新

本文首次提出视距差距概念,并通过1547篇论文的综述,建立了六大研究方向分类框架,同时区分了长时任务、长上下文和长时记忆三者的独立性。

方法详解

  • �� 构建语料库:通过八线程种子检索和两阶段过滤,收集1547篇论文。
  • �� 分类框架:按任务生命周期分为六类,并交叉分析视距承载方式。
  • �� 诊断性分析:将批判性文献作为研究主线,贯穿六大方向。

实验设计

实验基于文献综述,分析了过程奖励模型、轨迹级诊断和长时任务评估的现状,验证了视距差距的存在及其对模型性能的影响。

结果分析

研究发现,单步信号在长时任务中失效,需通过密集信号补偿;提出了改进测量方法的两大方向,并验证了诊断性文献的重要性。

应用场景

该研究为长时任务的规划、记忆和执行提供了理论支持,可广泛应用于自动化软件开发、复杂任务分解和长期用户交互。

局限与展望

语料库构建和分类可能存在偏差,未涵盖非英文文献和工业未发表工作,实验结果缺乏直接验证。

通俗解读 非专业人士也能看懂

想象你在厨房做一顿复杂的多道菜大餐。你需要规划每道菜的步骤、记住之前做了什么,还要确保所有菜同时完成。大语言模型就像一个厨师,但它只能记住一个步骤,做完一道菜就忘了之前的步骤。本文研究如何让“厨师”记住所有步骤,完成一顿完整的大餐。

简单解释 像给14岁少年讲一样

想象你玩一个很长的游戏任务,比如建造一个城堡。你需要记住之前做了什么,还要计划接下来的步骤。如果你忘了之前的建筑,城堡就会乱七八糟!大语言模型就像一个健忘的玩家,本文研究如何让它变得更聪明,记住所有事情,完成任务!

术语表

视距差距 (Horizon Gap)

指模型单步能力与长时任务完成能力之间的差距。

用于描述LLM在长时任务中的主要瓶颈。

长时任务 (Long-Horizon Task)

需要多步决策才能完成的任务。

本文的研究对象,涉及多小时任务。

过程奖励模型 (Process Reward Model)

通过生成密集信号来替代单步奖励的模型。

用于解决长时任务中单步信号失效的问题。

轨迹级诊断 (Trajectory-Level Diagnostics)

分析任务执行过程的诊断方法,而非仅关注最终结果。

用于评估长时任务的执行效果。

长时记忆 (Long-Term Memory)

系统在多个步骤或会话中保持信息的能力。

与长时任务的执行密切相关。

开放问题 这项研究留下的未解疑问

  • 1 如何分解模型能力与框架能力?
  • 2 如何避免训练与评估信号的相关偏差?
  • 3 长时任务可靠性是否有通用预测理论?

应用场景

近期应用

自动化代码生成

改进LLM在长时软件开发任务中的规划和执行能力。

复杂任务分解

支持多步骤任务的分解和执行,如项目管理。

远期愿景

长期用户交互

实现具有长时记忆的智能助手,支持跨会话的个性化服务。

原文摘要

Frontier language models solve reasoning problems in a single forward pass that would have been research contributions years ago, yet fail at multi-hour tasks: losing track of earlier decisions, declaring half-finished work done, or drifting from goals. We call this the horizon gap and survey 1,547 arXiv papers (2024-2026) collected via systematic seed harvest with a disclosed 26.8% bleed filter, extended by targeted supplementation. We disambiguate three routinely conflated properties: long-horizon (task property: required steps), long-context (model property: token capacity), and long-term memory (system property: persistence across steps/sessions). We organize the corpus into six categories tracking a long-horizon task's lifecycle -- planning, memory, execution, training, evaluation, and foundations/safety -- crossed with an axis capturing where horizons are carried (within-context, within-task-beyond-context, or cross-task-persistent). Across all categories, we find the same pattern: outcome-only signals grow uninformative as horizons lengthen, and the field's response -- whether process reward models, credit assignment, or trajectory-level diagnostics -- manufactures denser step-level signals. We treat critical and diagnostic literature as first-class threads throughout, arguing that segregating critique from method would routinely split single papers across chapters. We close by naming open measurement problems: decomposing model versus harness capability, managing correlated bias in process-level signals used for both training and evaluation, and whether long-horizon reliability admits general predictive theory.

cs.CL