VeRO: A Harness for Agents to Optimize Agents

TL;DR

提出VeRO框架,结合版本控制与奖励机制,提升编码代理优化性能。

cs.AI 🔴 高级 2026-02-26 11 引用 45 次浏览
Varun Ursekar Apaar Shanker Veronica Chatrath Yuan Xue Samuel Marc Denton
人工智能 代理优化 基准测试 代码生成 强化学习

核心发现

方法论

VeRO采用版本化、奖励和观察(Versioning, Rewards, Observations)策略,构建外部代理框架,支持目标代理的逐步改进。通过结构化的执行轨迹和预算控制,确保评估的可重复性与公平性。引入VeRO-Bench基准套件,涵盖多任务、多模型,系统评估优化器在不同场景中的表现。实证研究显示,VeRO显著提升了目标代理的性能,验证了不同优化策略的有效性。该方法结合版本控制(如Git)与结构化追踪,解决了代理优化中中间状态难以追踪的问题,为自动化代理改进提供了新工具。

关键结果

  • 在五个任务(数学推理、工具使用、多步问答、事实问答、科学问答)中,VeRO提升平均性能达8%,优于未使用框架的基线。不同优化器在任务间表现差异显著,工具增强策略效果更优。实验还表明,优化建议的多样性有限,主要集中在提示修改,但在复杂任务中效果更明显。多模型测试显示,VeRO在不同LLM(如GPT-4、Claude、GPT-5)上均有效,证明其泛化能力。
  • 通过对目标代理的版本追踪和结构化轨迹分析,验证了优化过程的可解释性和可控性。实验证明,预算限制下,VeRO能稳定找到性能提升的改进点,且不同任务对优化策略的敏感度不同。长远来看,VeRO为自动化代理调优提供了标准化平台,有助于推动编码代理在工业应用中的落地。
  • 在长时程编码任务中,VeRO通过多轮优化显著提高了终端任务的成功率(提升约12%),验证了其在复杂场景中的适用性。多模型迁移实验显示,优化成果具有一定的迁移性,但在不同模型间仍存在性能差异,提示未来需结合模型特性设计更适应的优化策略。

研究意义

该研究突破了传统软件工程中代理优化的局限,将其转化为结构化的代码生成任务。通过引入VeRO框架,解决了中间状态难以追踪、评估不一致等核心难题,为自动化构建高性能智能代理提供了理论基础和实践工具。此方法不仅提升了代理性能,也增强了优化过程的可解释性与可控性,为未来自主系统的开发提供了重要支撑。其在工业界的应用潜力巨大,有望推动智能系统的快速迭代与优化,降低人工调优成本,促进AI在复杂任务中的广泛部署。

技术贡献

VeRO创新性地结合版本控制、结构化追踪与预算管理,构建了一个通用的代理优化平台。该平台支持多模型、多任务、多优化策略的公平比较,提供了标准化的评估流程。引入VeRO-Bench作为多任务评测基准,丰富了编码代理性能评价体系。技术上,VeRO实现了对中间状态的详细追踪,确保了优化过程的可解释性,并通过严格的资源限制,保障了评估的公平性。这为未来自动化代理调优提供了坚实的工程基础和理论保障。

新颖性

本研究首次提出将代理优化问题系统化为代码生成任务,结合版本控制和结构化追踪,建立了标准化的评估框架。与现有的prompt优化或任务特定调优不同,VeRO支持对整个代理程序的迭代改进,具有更高的灵活性和扩展性。其引入的多任务基准和实证分析,为代理优化提供了新的研究范式,填补了该领域缺乏系统化评测的空白。

局限性

  • VeRO在复杂任务中表现受限,尤其在推理类任务中优化效果有限,可能与模型本身的推理能力有关。
  • 当前框架对优化空间的限制较多,主要集中在提示和参数调节,缺乏对深层结构改动的支持。
  • 实验成本较高,尤其在长时程任务中,评估每次改动的资源消耗较大,限制了大规模应用的可能性。

未来方向

未来将探索更丰富的优化空间,包括深层代码结构改动和模型架构调整。计划引入强化学习与演化算法结合的混合优化策略,提升优化效率。还将扩展多模态任务和多任务学习,增强框架的适应性和泛化能力。此外,结合自动化数据采集与标注,推动代理自主学习与持续改进,为工业级应用提供更强的技术支撑。

AI 总览摘要

随着大规模语言模型(LLM)在智能代理中的广泛应用,如何系统性提升代理性能成为研究热点。传统方法多依赖人工调优,效率低且难以规模化。本文提出VeRO(版本控制、奖励、观察)框架,构建了一个支持目标代理逐步改进的自动化平台。VeRO结合Git版本管理和结构化轨迹追踪,确保每次改动的可追溯性和公平评估。通过引入VeRO-Bench多任务基准,涵盖数学推理、工具使用、多步问答等场景,系统评估不同优化器的表现。实验证明,VeRO在多模型、多任务中均能显著提升目标代理性能,平均提升达8%。在复杂长时程任务中,优化效果更为明显,验证其在工业应用中的潜力。该方法不仅增强了代理优化的可解释性,也为未来自主系统的开发提供了坚实基础。尽管如此,VeRO在推理任务中的提升仍有限,未来将结合深层结构优化和强化学习策略,进一步推动自动化智能代理的发展。整体而言,VeRO为智能系统的自动调优提供了创新范式,具有重要的学术价值和应用前景。

深度分析

研究背景

近年来,LLM驱动的智能代理逐渐成为AI研究的焦点。早期工作如ReAct、Toolformer等,强调通过提示工程提升性能,但缺乏系统化的优化框架。SWE-Bench等基准推动了编码代理的评测,但多局限于静态任务。随着代理应用的复杂化,如何自动化调优成为难点。传统软件工程中的版本控制和调试工具,为代理优化提供启示,但未充分结合LLM的随机性和中间状态追踪。近年来,强化学习和演化算法在代理优化中展现潜力,但缺乏统一的评估平台。VeRO借鉴软件工程中的最佳实践,结合结构化追踪和预算管理,提出了全新的代理优化体系。

核心问题

当前代理优化多依赖人工调试,效率低、成本高,且难以保证优化的可重复性和公平性。尤其在多轮交互和复杂任务中,缺乏系统化的追踪和评估机制,导致优化效果难以量化。现有方法多集中在提示优化,忽视程序整体结构的改进。缺少标准化的基准和评估体系,使得不同方法难以公平比较。这些问题限制了代理在工业中的大规模应用,也阻碍了自动化智能系统的快速发展。

核心创新

VeRO的核心创新在于:1)引入版本控制机制,确保每次改动可追溯;2)结构化执行轨迹,提升优化的可解释性;3)预算限制,保证评估的公平性;4)多任务基准,系统评价不同优化策略。该框架支持多模型、多任务、多策略的公平比较,提供了标准化的评估流程。通过结合软件工程中的最佳实践,VeRO实现了对中间状态的详细追踪和控制,为自动化代理调优提供了新思路。其创新点在于将代理优化系统化、标准化,为未来研究提供了坚实基础。

方法详解

  • �� 目标定义:将代理优化转化为代码改动任务,目标是提升在特定任务上的表现。• 版本管理:利用Git工作树隔离不同版本,自动记录每次改动。• 结构化追踪:采集执行轨迹,包括输入、输出、调用和中间推理步骤。• 预算控制:通过评估调用次数限制优化过程,确保公平性。• 观察接口:设计统一的f函数,提供轨迹、版本和性能信息。• 评估机制:封装在Evaluator中,确保每次评估一致性。• 优化循环:由编码代理(如GPT-4)生成改动,执行、评估、记录,持续迭代。• 实验设计:在多任务、多模型环境中,比较不同优化策略的效果,分析优化轨迹和性能提升。

实验设计

采用五个任务(数学推理、工具使用、多步问答、事实问答、科学问答),利用不同模型(GPT-4、Claude、GPT-5)进行评估。每个任务设置不同的评估指标(性能提升、稳定性、效率),在预算限制下测试多种优化策略。通过多轮迭代,比较不同代理(如默认、资源限制、调度器)的性能变化。还进行迁移性测试,验证优化成果在不同模型间的泛化能力。长时程任务中,测试多轮优化对成功率的提升,分析优化路径的稳定性。实验充分控制环境,确保公平性,结果揭示了不同策略在不同任务中的表现差异。

结果分析

VeRO在五个任务中平均性能提升达8%,工具增强策略效果更明显,尤其在工具使用任务中表现优异。多模型迁移实验显示,优化成果具有一定的迁移性,但在不同模型间存在性能差异。长时程任务中,优化显著提高成功率(提升约12%),验证了其在复杂场景中的适用性。不同优化策略的效果差异,提示未来应结合任务特性设计定制化方案。整体来看,VeRO显著推动了代理性能的提升,为自动化调优提供了有效工具。

应用场景

该框架可应用于工业中的自动化智能系统调优,如客服机器人、自动驾驶、工业控制等。只需定义任务和模型,VeRO即可自动生成改动,提升系统性能。其结构化追踪和公平评估机制,确保调优过程透明、可控,有助于企业快速迭代产品。未来,结合云端资源,可以实现大规模代理优化,降低人工成本,提升系统智能水平。

局限与展望

VeRO在推理和复杂逻辑任务中表现有限,可能因模型推理能力不足导致优化效果不明显。对深层结构改动支持有限,主要集中在提示和参数调整。评估成本较高,长时程任务中资源消耗大,限制了大规模应用。未来需结合模型架构优化和更高效的搜索策略,提升整体性能。

通俗解读 非专业人士也能看懂

想象你在厨房做菜,想让一道菜变得更好吃。你可以试试不同的调料、火候或摆盘方式,但每次尝试都需要记录下来,避免重复。VeRO就像一个智能厨师助手,它帮你记录每次改动,观察结果,然后告诉你哪种改法最有效。它还会控制你试验的次数,确保不会浪费太多食材。通过不断试错和记录,最终你能做出最受欢迎的菜。这种方法让改进变得系统化、科学化,不再盲目试错,而是有据可依。它让厨房变成了一个高效的创新工厂,每次改良都能追溯,效果也更可靠。

简单解释 像给14岁少年讲一样

想象你在学校里参加一个比赛,想让你的作品变得更棒。你可以试试不同的想法,比如换个颜色、加点新内容,但每次都要记下来,看看哪个最受评委喜欢。VeRO就像你的聪明助手,它帮你记每次的改动和结果,然后告诉你哪些变化让你的作品更出色。它还会限制你试验的次数,确保你不会浪费时间和材料。通过不断尝试和记录,你最终可以找到最好的方案。这个过程就像在做科学实验一样,有条理、可追溯,让你变得更聪明、更有条理。这样一来,你的作品就能不断改进,变得越来越棒!

原文摘要

An important emerging application of coding agents is agent harness optimization: the iterative improvement of a target agent by editing and evaluating its code. Despite its relevance, the community lacks a systematic understanding of coding agent performance on this task. Harness optimization differs from conventional software engineering: agent harnesses interleave deterministic code with stochastic LLM completions, requiring structured capture of both intermediate execution traces and downstream outcomes. To address these challenges, we introduce (1) VeRO (Versioning, Rewards, and Observations), an outer harness that provides versioned snapshots, budget-controlled evaluation, and structured execution traces of target harnesses, and (2) VeRO-Bench, a benchmark suite of target agents and tasks with reference evaluation procedures. Using VeRO, we conduct an empirical study comparing optimizers across tasks and analyzing which modifications reliably improve target agent harnesses. We release VeRO to support research on agent optimization as a core capability for coding agents. Code is available at https://github.com/scaleapi/vero.

cs.AI cs.CL cs.LG

参考文献 (20)

Measuring short-form factuality in large language models

Jason Wei, Karina Nguyen, Hyung Won Chung 等

2024 356 引用 ⭐ 高影响力 查看解读 →

GPQA: A Graduate-Level Google-Proof Q&A Benchmark

David Rein, Betty Li Hou, Asa Cooper Stickland 等

2023 3348 引用 ⭐ 高影响力 查看解读 →

The FACTS Leaderboard: A Comprehensive Benchmark for Large Language Model Factuality

Aileen Cheng, Alon Jacovi, A. Globerson 等

2025 14 引用 ⭐ 高影响力 查看解读 →

Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces

Mike A. Merrill, Alexander G Shaw, Nicholas Carlini 等

2026 422 引用 ⭐ 高影响力 查看解读 →

Meta-Harness: End-to-End Optimization of Model Harnesses

Yoonho Lee, R. Nair, Qizheng Zhang 等

2026 180 引用 查看解读 →

Trace is the New AutoDiff - Unlocking Efficient Optimization of Computational Workflows

Ching-An Cheng, Allen Nie, Adith Swaminathan

2024 5 引用

DROP: A Reading Comprehension Benchmark Requiring Discrete Reasoning Over Paragraphs

Dheeru Dua, Yizhong Wang, Pradeep Dasigi 等

2019 1374 引用 查看解读 →

Measuring Mathematical Problem Solving With the MATH Dataset

Dan Hendrycks, Collin Burns, Saurav Kadavath 等

2021 6422 引用 查看解读 →

Evaluating Large Language Models Trained on Code

Mark Chen, Jerry Tworek, Heewoo Jun 等

2021 11503 引用 查看解读 →

Violation.

M. Rigge

1989 21 引用

Program Synthesis with Large Language Models

Jacob Austin, Augustus Odena, Maxwell Nye 等

2021 4480 引用 查看解读 →

Training Verifiers to Solve Math Word Problems

K. Cobbe, V. Kosaraju, Mo Bavarian 等

2021 10599 引用 查看解读 →

A survey on large language model based autonomous agents

Lei Wang, Chengbang Ma, Xueyang Feng 等

2023 3878 引用 查看解读 →

Large Language Models as Optimizers

Chengrun Yang, Xuezhi Wang, Yifeng Lu 等

2023 1108 引用 查看解读 →

Self-Taught Optimizer (STOP): Recursively Self-Improving Code Generation

E. Zelikman, Eliana Lorch, L. Mackey 等

2023 140 引用 查看解读 →

DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines

O. Khattab, Arnav Singhvi, Paridhi Maheshwari 等

2023 1007 引用 查看解读 →

SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

Carlos E. Jimenez, John Yang, Alexander Wettig 等

2023 3781 引用 查看解读 →

GAIA: a benchmark for General AI Assistants

G. Mialon, Clémentine Fourrier, Craig Swift 等

2023 1208 引用 查看解读 →

Mathematical discoveries from program search with large language models

B. Romera-Paredes, Mohammadamin Barekatain, Alexander Novikov 等

2023 1308 引用

LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code

Naman Jain, King Han, Alex Gu 等

2024 2142 引用 查看解读 →

被引用 (11)

VideoResearcher: Self-Improving Tool Design for Long-Video Understanding

Studying Without a Syllabus: Task-Agnostic Environment Preprocessing

EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents

HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?

2026 2 引用 查看解读 →

A Control-Theoretic Approach for Resource-Aware Consensus in Multi-Agent AI

Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development

Evo-Bench: Can Language Models Improve Agent Harness?

2026 2 引用 查看解读 →

HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

2026 1 引用 查看解读 →

HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution

2026 5 引用 查看解读 →

Towards Direct Evaluation of Harness Optimizers via Priority Ranking

2026 1 引用 查看解读 →

Insights Generator: Systematic Corpus-Level Trace Diagnostics for LLM Agents