Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

TL;DR

提出长远终端基准Long-Horizon-Terminal-Bench,涵盖46个长流程任务,强调密集奖励与部分信用,评估模型长时表现。

cs.AI 🔴 高级 2026-07-10 41 次浏览
Zongxia Li Zhongzhi Li Yucheng Shi Ruhan Wang Junyao Yang Zhichao Liu Xiyang Wu Anhao Li Yue Yu Ninghao Liu Lichao Sun Haotao Mi Leowei Liang
长流程任务 密集奖励 终端基准 深度规划 模型评估

核心发现

方法论

本文构建了基于容器化终端环境的长流程任务集,结合细粒度子任务评分机制,实现对模型在复杂、开放式工作流中的持续进展评估。采用多类别任务设计,涵盖实验复现、软件工程、科学计算等领域。每个任务由参考方案或模拟引擎支撑,利用密集奖励和部分信用机制,鼓励模型在多次尝试中逐步推进。模型评估采用多轮多次运行,统计平均耗时、Token数和成功率,结合子任务得分实现多维度性能分析。

关键结果

  • 在17个前沿模型中,平均每任务耗时88.9分钟,Token使用9.8M,最大成功率为28.3%(R≥0.95),平均成功率仅6.4%,显示长流程任务对模型的挑战远超以往基准。
  • 模型在密集奖励机制下表现出明显的近似成功(R在0.75-0.95之间)但难以完成全部流程,揭示模型在持续规划和验证方面的瓶颈。
  • 模型成本分析显示,最优模型Grok 4.5每任务约花费11美元,远低于其他模型,但成功率仍有巨大提升空间。

研究意义

该基准突破了传统只关注最终状态的评估限制,强调中间过程的连续性和部分成功,为长时任务中的模型能力提供更细粒度的衡量标准。推动AI在复杂、长周期工作流中的应用,具有重要理论和实践价值。

技术贡献

提出子任务密集评分机制,结合容器化环境实现多领域任务的标准化评测。引入多轮多次试验统计成功率,揭示模型在长流程中的持续性和验证能力。丰富了长流程任务的设计思路,为未来模型优化提供了细粒度反馈。

新颖性

首次在长流程终端任务中引入密集奖励与子任务评分机制,突破以往只关注最终状态的评估方式。结合多类别、多阶段任务设计,系统性评估模型在复杂工作流中的表现,填补了长流程模型评估的空白。

局限性

  • 当前任务多依赖模拟环境,实际应用中可能面临环境不确定性和复杂性增加的问题。模型在长时间连续执行中的鲁棒性仍需提升,尤其在调试和验证环节表现不足。此外,评估成本较高,未来需优化模型效率与成本比。

未来方向

未来将探索更高效的模型架构,增强模型在长流程中的鲁棒性和自我验证能力。扩展任务类型,涵盖更多实际应用场景,推动模型在工业级长周期任务中的落地。同时,优化评估体系,降低成本,提高评测的普适性和实用性。

AI 总览摘要

随着人工智能技术的不断发展,现有模型在短流程任务中表现出色,但在长流程、复杂工作流中的能力仍有限。传统评估主要关注任务最终状态,忽略了中间过程的连续性与部分成功,难以全面衡量模型的实际应用潜力。为此,本文提出了Long-Horizon-Terminal-Bench(LHTB),这是一个涵盖46个跨领域长流程任务的终端基准,强调密集奖励与部分信用机制,旨在推动模型在长时间、多步骤工作流中的表现提升。

LHTB设计了细粒度子任务评分体系,将复杂任务拆解为多个阶段性目标,模型在执行过程中获得持续反馈。这一机制不仅激励模型在中间阶段持续推进,还能揭示模型在调试、验证、计划等方面的瓶颈。实验中,评估了17个前沿模型,发现即使最优模型Grok 4.5成功率也仅为28.3%,远低于理想水平,显示长流程任务对模型的挑战依然巨大。

结果表明,密集奖励机制有效区分模型在持续执行中的能力差异,揭示了模型在长时间内保持进展、验证完成度方面的不足。该基准的引入,为未来模型在工业级复杂任务中的应用提供了重要的评估工具和研究方向,推动AI在自动化、科研等领域的长周期任务解决方案发展。尽管如此,模型的成本、鲁棒性和环境适应性仍需优化,未来工作将聚焦于提升模型效率、扩展任务多样性、降低评估成本,推动长流程AI的广泛应用。

深度分析

研究背景

近年来,随着大规模预训练模型(如GPT、BERT)在自然语言处理中的突破,AI在短流程任务中表现出色。然而,实际应用中许多工作流程具有长远规划、多阶段调试和多模态数据处理的特点,传统基准难以反映模型在此类复杂场景中的能力。早期工作如Terminal-Bench和SWE-Bench主要关注任务的最终状态,缺乏对中间过程的细粒度评估。长流程任务的挑战在于持续规划、错误修正和验证能力,亟需新的评估体系。本文借鉴工业、科研中的长周期工作流程,设计了多领域、多阶段的任务集,结合密集奖励机制,旨在推动模型在复杂、长时间工作流中的表现。

核心问题

现有终端基准多局限于短时间、单一目标任务,无法全面反映模型在长流程中的持续能力。长流程任务涉及多次交互、多阶段调试,模型在保持长时间的连续性、验证中间结果方面表现不足,导致实际应用中难以信赖。如何设计一个既真实反映复杂工作流,又能细粒度评估模型能力的基准,是当前的核心难题。该问题的解决,将有助于推动AI在科研、工业自动化等领域的长周期应用,提升模型的实用性和鲁棒性。

核心创新

本研究的创新点主要体现在:1)引入密集子任务评分机制,将复杂任务拆解为多个阶段性目标,提供连续反馈;2)采用容器化环境,确保任务的可复现性和多样性;3)结合多类别任务设计,涵盖科研、工程、科学计算等多个领域;4)多轮多次试验统计模型在长流程中的持续表现,揭示模型在调试、验证方面的瓶颈。这些创新突破了传统只关注最终状态的评估方式,为长流程模型的能力评估提供了全新的思路。

方法详解

  • �� 构建多领域任务集,基于真实长流程工作场景设计,确保任务的复杂性和多样性。• 每个任务在容器环境中运行,配备参考方案和模拟引擎,支持全流程操作。• 设计子任务体系,将任务拆解为具有语义意义的阶段性目标,每个子任务配备检测机制。• 采用密集奖励机制,根据子任务完成情况给予连续评分,鼓励模型在中间阶段持续推进。• 评估采用多轮多次运行,统计平均成功率、耗时和Token数,分析模型在长时间内的表现。• 结合成功率和平均奖励,全面衡量模型的持续性和验证能力。

实验设计

实验中,评估了17个前沿模型,包括GPT-5系列、Grok 4.5、DeepSeek V4 Pro等,任务涵盖软件工程、科学计算、地球科学等领域。每个模型在每个任务上运行多次,统计平均耗时、Token使用和成功率。采用密集子任务评分,分析模型在不同阶段的表现差异。实验还包括成本分析,比较不同模型的效率与效果。通过对失败案例的分析,识别模型在调试、验证和持续推进中的瓶颈,为未来优化提供依据。

结果分析

实验结果显示,最优模型Grok 4.5在R≥0.95条件下成功率为28.3%,平均成功率仅6.4%,远低于理想水平。模型在中间阶段表现出明显的近似成功(R在0.75-0.95之间),但难以完成全部流程。密集奖励机制有效区分模型在持续执行中的能力差异,揭示模型在长时间保持进展和验证方面的不足。成本分析表明,最优模型每任务花费约11美元,仍有较大提升空间。整体来看,长流程任务对模型提出了更高的持续性和验证能力要求。

应用场景

该基准可广泛应用于科研、工业自动化、软件工程等领域的长周期任务评估,帮助开发更鲁棒、持续能力强的AI模型。未来,结合此评估体系,可推动自动化调试、科研数据分析、复杂系统管理等实际场景中的AI应用,提升效率和可靠性。

局限与展望

当前任务多依赖模拟环境,实际场景中环境复杂性和不确定性增加,模型在真实环境中的表现尚未验证。长时间连续执行对模型鲁棒性和资源消耗提出更高要求,成本较高。模型在调试、验证环节仍存在瓶颈,未来需优化算法和架构以提升效率和适应性。

通俗解读 非专业人士也能看懂

想象你在经营一家复杂的工厂,工厂里有很多不同的生产线,每条线都需要按照一定的步骤逐步完成任务。有时候,某个环节出错了,你需要检查、修正,确保整个生产流程顺利进行。传统的评估就像只看最后成品是否合格,但实际上,工厂的管理者更关心每个环节是否都按步骤完成,是否在出现问题时及时修正。本文提出的方法就像给每个环节都打分,告诉你在哪些步骤做得好,哪些还需要改进。这样,工厂管理者就能更清楚地知道整个流程的运行状况,而不是只看最终的成品。模型在长流程中也一样,不仅要完成最终目标,还要在每个中间步骤都表现良好,才能真正实现智能自动化。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,比如冒险游戏,里面有很多关卡和任务。以前的游戏只会告诉你最后是不是赢了,但其实,真正厉害的玩家还会关注每一步是不是走对了,是否在正确的时间做了正确的事情。这个研究就像设计了一个特别聪明的游戏评测系统,它会在你玩游戏的过程中不断给你打分,告诉你在哪些地方做得好,哪些地方还可以。这样,你就能知道自己在长时间的冒险中,哪个部分还需要练习。研究的目标是让AI像人一样,能在长时间、复杂的任务中坚持下去,不仅能完成目标,还能在途中不断改进。虽然目前AI还不够强大,但这个方法让我们看到了未来AI能更聪明、更持久的可能性。

原文摘要

AI agents have become capable of autonomously completing short, well-specified tasks. However, existing terminal benchmarks largely focus on simple problems that finish within minutes and are evaluated only by their final outcome. This setup overlooks intermediate progress and partial solutions, yielding sparse reward signals and an incomplete picture of agent capability. We introduce Long-Horizon-Terminal-Bench, a terminal benchmark of 46 long-horizon tasks spanning nine categories, including experiment reproduction, software engineering, multimodal analysis, interactive games, and scientific computing. Each task follows a Terminal-Bench-style setup with a reference solution or simulation engine, but is further decomposed into fine-grained graded subtasks. This design enables dense intermediate rewards and partial credit, allowing evaluation to capture not only whether an agent reaches the final goal, but also how far it progresses on open-ended workflows. Tasks in Long-Horizon-Terminal-Bench typically require hundreds of episodes and minutes to hours of execution, stressing long-horizon planning, long-context management, and iterative debugging rather than one-shot problem solving. We evaluate 15 frontier models and find that agents consume on average 9.9M tokens per task, with roughly 231 episodes and 85.3 minutes of execution time per run, making Long-Horizon-Terminal-Bench more demanding than prior terminal-based benchmarks. Even the strongest tested model achieves 15.2% pass@1 at a partial-reward threshold of 0.95 and 10.9% at a perfect-reward threshold of 1.0, while the mean pass rate across models is 4.3% and 1.7% under the two thresholds, respectively. These results reveal headroom for improvement. We further analyze failure modes and error patterns, and release Long-Horizon-Terminal-Bench to support future progress on long-horizon terminal agents.

cs.AI