Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development
提出了一种评估长时间AI研究的框架,分析36项任务中7个模型的表现。
核心发现
方法论
本文提出了一种系统评估框架,使用规则化指标分析长时间任务中的解决方案框架、执行和反馈控制。通过对比不同任务中的经验重用效果,揭示了当前代理在自主研究中的局限性。
关键结果
- 结果1:在36项任务中,Opus-4.7在avg@3和best@3上分别达到0.739和0.790,表现最佳。
- 结果2:GPT-5.5在执行上表现优异,得分0.958,但在反馈控制上仅为0.858。
- 结果3:经验重用在任务间的影响显著,DeepSeek-V4-Pro的avg@3提高0.093,而Gemini-3.1-Pro下降0.017。
研究意义
该研究揭示了当前AI代理在长时间研究中的局限性,强调了经验重用和工具设计对性能的影响。这为未来的模型训练和系统设计提供了具体方向。
技术贡献
本文的技术贡献在于提供了一种细粒度的评估方法,能够识别出模型在不同研究阶段的具体瓶颈,超越了传统的最终得分评估。
新颖性
首次系统性地评估了长时间AI研究代理的表现,揭示了当前模型在自主研究能力上的不足。
局限性
- 局限1:模型在不同运行中的表现差异大,难以稳定复现。
- 局限2:真正的方法创新仍然稀缺,主要依赖现有技术的组合。
未来方向
未来研究可集中于改进模型训练策略、增强推理时策略、优化经验管理以及工具设计,以提高自主研究能力。
AI 总览摘要
长时间AI研究中的自主代理正变得越来越重要,但现有的评估方法往往只关注最终得分,忽略了过程中的细节和经验重用的效果。本文提出了一种新的评估框架,通过分析解决方案框架、执行和反馈控制三个方面,揭示了当前代理在长时间任务中的表现和局限。
研究表明,当前的AI代理更像是工程优化器,而非完全自主的研究者。虽然它们能够制定和实施实用的解决方案,但在不同运行中的表现差异很大,真正的方法创新仍然稀缺。分析还发现,经验重用可以帮助或误导后续决策,而工具设计则影响性能的稳定性。
这些发现为改进模型训练、推理策略、经验管理和工具设计提供了具体方向,推动了长时间AI研究的进一步发展。
深度分析
研究背景
随着AI技术的发展,长时间的自主研究逐渐成为可能。现有的研究大多集中于短期任务,缺乏对长时间任务中AI代理表现的系统评估。本文填补了这一空白,通过分析36项长时间任务中的7个前沿模型,揭示了当前AI代理的能力和不足。
核心问题
长时间AI研究的核心问题在于如何有效评估代理的表现。传统的最终得分评估无法揭示模型在研究过程中的具体表现和经验重用的效果,导致难以识别出改进的具体方向。
核心创新
本文的创新在于提出了一种新的评估框架,能够细粒度地分析代理在长时间任务中的表现。通过对比不同任务中的经验重用效果,揭示了当前代理在自主研究中的局限性。
方法详解
- �� 解决方案框架:分析代理在任务中的方向选择。
- �� 执行:评估代理将方案转化为可执行结果的能力。
- �� 反馈控制:考察代理如何利用反馈调整后续决策。
- �� 经验重用:通过对比不同任务中的表现,分析经验重用的效果。
实验设计
实验设计包括36项长时间任务,涵盖模型开发、系统优化、挑战与难题、CUDA等四个类别。每个任务提供一个初始工件和一个专家参考解决方案,代理需在规定时间内优化工件。
结果分析
结果显示,Opus-4.7在avg@3和best@3上表现最佳,分别为0.739和0.790。GPT-5.5在执行上表现优异,但在反馈控制上略逊一筹。经验重用在任务间的影响显著,DeepSeek-V4-Pro的avg@3提高0.093,而Gemini-3.1-Pro下降0.017。
应用场景
该研究的应用包括改进AI模型的训练策略、增强推理时策略、优化经验管理以及工具设计,以提高自主研究能力。
局限与展望
当前模型在不同运行中的表现差异大,难以稳定复现。真正的方法创新仍然稀缺,主要依赖现有技术的组合。未来研究需集中于改进模型训练策略和工具设计。
通俗解读 非专业人士也能看懂
想象一下,一个厨房里有几个厨师,他们需要在有限的时间内制作出最好的菜肴。每个厨师都有自己的方法,有的擅长快速找到最佳食材,有的则在烹饪过程中不断调整以达到最佳味道。本文中的AI代理就像这些厨师,它们在长时间任务中需要不断尝试和调整,以找到最佳解决方案。通过分析这些厨师在不同阶段的表现,我们可以更好地理解他们的优缺点,从而为未来的改进提供方向。
简单解释 像给14岁少年讲一样
想象你在玩一个长时间的游戏,需要不断升级和调整策略才能赢。AI代理就像游戏中的角色,它们在长时间任务中需要不断尝试和调整,以找到最佳解决方案。通过分析这些角色在不同阶段的表现,我们可以更好地理解它们的优缺点,从而为未来的改进提供方向。是不是很酷?
术语表
长时间AI (Long-Horizon AI)
指在长时间任务中进行自主研究的人工智能。
用于评估AI代理在长时间任务中的表现。
解决方案框架 (Solution Framing)
分析代理在任务中的方向选择。
用于评估代理在任务中的表现。
执行 (Execution)
评估代理将方案转化为可执行结果的能力。
用于分析代理的执行能力。
反馈控制 (Feedback Control)
考察代理如何利用反馈调整后续决策。
用于评估代理的反馈利用能力。
经验重用 (Experience Reuse)
通过对比不同任务中的表现,分析经验重用的效果。
用于分析经验重用对代理表现的影响。
开放问题 这项研究留下的未解疑问
- 1 如何提高AI代理在不同运行中的稳定性,减少表现差异。
- 2 如何在长时间任务中实现真正的方法创新。
应用场景
近期应用
模型训练优化
通过改进训练策略,提高AI代理在长时间任务中的表现。
远期愿景
自主研究系统
开发能够在长时间任务中进行自主研究的AI系统,实现真正的自主创新。
原文摘要
Autonomous agents are increasingly capable of improving models, systems, and other technical artifacts through long-horizon experimentation. To understand the current state of this capability, however, evaluation must go beyond final scores, which neither reveal where progress is gained or lost nor indicate whether accumulated experience improves later decisions. We therefore present a systematic evaluation of seven frontier models on 36 long-horizon tasks based on a new framework that uses rule-based metrics to characterize within-run behavior through Solution Framing, Execution, and Feedback Control and controlled comparisons to assess experience reuse within and across tasks. The results show that current agents operate more like engineering optimizers than fully autonomous researchers: they can formulate and implement practical solutions, but their performance varies substantially across runs, their strongest solutions mainly adapt or combine established techniques, and genuine methodological novelty remains rare. Detailed analysis reveals that observed performance is shaped by multiple factors, including distinct process bottlenecks behind similar final outcomes, experience reuse that can help or mislead subsequent decisions, and harness designs that affect performance stability. These findings suggest concrete directions for improving model training, inference-time strategies, experience management, and harness design.