核心发现
方法论
本文提出Ledger,一种确定性运行时层,利用在线执行账本将代理的交互行为转化为明确的执行状态,包括已观察、已修改和已尝试的内容。通过两个路径(inform和govern)在每一步前后操作,前者在prompt中加入紧凑状态视图,后者在执行前对命令进行验证,避免重复工作。Ledger无需额外模型调用,兼容未修改的代理架构。实验证明,在500个SWE-bench验证实例中,Ledger显著提升Pass@1(GPT-5 mini由56.2%提升至64.2%,MiniMax M2.5由75.8%提升至81.0%),同时降低总成本约28-32%。
关键结果
- Ledger在所有测试实例中均提升了代理的成功率,Pass@1提升幅度最高达8.0个百分点,成本降低幅度达31.8%。具体而言,GPT-5 mini模型成本降低28.9%,模型调用减少11.7%,重复读取减少24.2%;MiniMax M2.5模型成本降低31.8%,调用减少31.9%,重复读取减少35.1%。
- 结合治理(govern)和信息(inform)路径,效果最优,治理主要提升解决率,信息提升效率。Ledger在不同代理架构中均表现出优越性,验证其广泛适用性。
- Ablation分析显示,治理路径主要驱动解决率提升,信息路径则显著减少冗余读取,二者结合实现最优性能。实验还表明,Ledger在不增加模型调用的情况下,显著改善长时程推理表现。
研究意义
该研究突破了长时程编码代理中执行状态模糊的问题,提供一种无需修改模型架构的高效管理机制。通过明确追踪已观察和已修改内容,有效避免重复劳动,提升系统整体效率和成功率。这不仅推动软件自动化修复、代码生成等领域的发展,也为未来大规模AI代理的可解释性和可靠性提供了技术基础。Ledger的设计理念强调透明、可控的执行流程,为复杂任务中的状态管理树立新标杆,具有深远的学术和工业价值。
技术贡献
技术上,Ledger引入一种基于确定性账本的执行状态管理机制,区别于传统的基于历史摘要或模型推理的方案。它通过观察、修改和命令三类记录,机械地反映代理的实际交互状态,避免模型在长序列中丢失关键信息。该机制无需模型调用,兼容多种代理架构,极大提升了系统的可扩展性和效率。实验验证其在多模型、多任务场景中的优越性能,展示了其在实际软件工程中的应用潜力。
新颖性
本研究首次提出将执行状态作为明确、机械可推导的事实,融入长时程编码代理中,避免了传统方法中对历史摘要的依赖。Ledger通过两个路径(inform和govern)实现状态的透明展示和命令的智能调度,突破了以往仅依赖模型推理的局限。这种设计在保持模型纯粹理解能力的同时,显著提升了效率和成功率,代表了长时程代理管理的创新方向。
局限性
- Ledger依赖于命令和观察的机械记录,可能在高频变更或复杂操作中出现状态滞后或误判,影响效果。
- 在极端复杂或动态变化的环境中,账本维护的准确性和实时性可能受到挑战。
- 目前未考虑多代理协作场景,未来需扩展多主体状态同步机制。
未来方向
未来将探索Ledger在多模态、多任务环境中的扩展,提升其在实际工业场景中的适应性。还将结合学习机制优化账本维护策略,减少人为干预。同时,研究如何结合模型推理与机械状态管理,进一步提升系统的鲁棒性和智能化水平。
AI 总览摘要
长时程编码代理在软件工程、自动化修复等任务中展现出巨大潜力,但其面临的核心挑战是如何有效管理庞大的交互历史。传统方法多依赖于截断或摘要,难以保证信息的实时性和准确性,导致代理在多轮交互中频繁重复工作或依赖过时信息。本文提出Ledger,一种基于确定性账本的运行时层,专为解决这一问题而设计。
Ledger通过两个路径——inform和govern,动态维护和利用代理的执行状态。inform路径在每次行动前,将当前状态以紧凑视图加入prompt,确保模型理解最新的交互进展;govern路径在命令执行前,评估其是否已在账本中存在有效结果,避免重复执行。这一机制无需额外模型调用,兼容多种代理架构。
在500个SWE-bench验证实例中,Ledger显著提升了代理的成功率,GPT-5 mini模型的Pass@1从56.2%提升至64.2%,MiniMax M2.5从75.8%提升至81.0%。同时,整体成本降低了28-32%,模型调用减少11-32%,重复读取显著减少。这表明,明确的执行状态管理不仅提升了效率,也增强了系统的可靠性。
实验还显示,治理路径主要提升解决率,信息路径则优化效率,两者结合效果最佳。Ledger的设计理念强调透明、机械的状态追踪,避免模型在长序列中遗失关键信息,为未来大规模AI代理提供了新思路。其无需修改模型架构,兼容多场景,具有广泛的应用前景和深远的学术价值。
深度分析
研究背景
近年来,大型语言模型(LLMs)在软件开发、代码修复等领域取得突破,但长时程交互管理仍是难点。传统方法通过截断或摘要减少上下文长度,但难以保证信息的完整性和实时性。相关研究如Wang等提出的交互摘要技术,虽改善了部分性能,但未解决状态一致性问题。现有方案多依赖模型推理维护状态,存在效率低、信息丢失等问题。随着模型规模扩大,长序列管理的复杂性不断增加,亟需一种高效、透明的状态管理机制,以支持复杂任务中的连续推理。
核心问题
长时程编码代理在多轮交互中难以准确追踪当前执行状态,导致重复劳动和信息滞后。现有方法多依赖历史摘要,易丢失关键细节或引入偏差,影响任务成功率。如何在不增加模型调用的情况下,机械、实时地维护和利用交互状态,成为亟待解决的核心问题。这不仅关系到系统效率,也影响其在复杂场景中的可靠性和可解释性。
核心创新
Ledger的核心创新在于引入机械可推导的执行状态账本,区别于传统的基于模型推理的状态维护。它通过观察、修改和命令三类记录,机械反映代理的实际交互,避免信息遗失。两个路径(inform和govern)实现状态的透明展示和命令的智能调度,极大提升效率和成功率。该机制无需模型调用,兼容多架构,提供一种高效、可扩展的状态管理方案,突破了长时程代理的瓶颈。
方法详解
- �� 交互历史:存储代理的所有操作和观察。
- �� 账本维护:实时更新观察、修改和命令记录,确保状态一致性。
- �� inform路径:在每次行动前,将当前状态渲染成紧凑视图加入prompt。
- �� govern路径:在命令执行前,评估是否已有有效结果,避免重复。
- �� 结果应用:根据评估,决定执行、复用或提示,更新交互历史。
- �� 无需模型调用:所有状态机械维护,兼容多模型架构。
- �� 实验验证:在500实例中测试,比较不同模型和方法的性能。
实验设计
采用SWE-bench验证集,使用mini-swe-agent和OpenAI Codex两种代理架构,评估指标为Pass@1和总成本。对比基线和Ledger增强版本,进行ablation以分析治理和信息路径的贡献。超参数包括模型类型(GPT-5 mini、MiniMax M2.5)和任务规模,确保结果的统计显著性。测试中还分析了重复读取和调用次数变化,验证效率提升。
结果分析
Ledger在所有实例中均显著提升成功率,Pass@1最高提升8.0个百分点,成本降低最高达31.8%。GPT-5 mini模型成本降低28.9%,调用减少11.7%,重复读取减少24.2%;MiniMax M2.5模型成本降低31.8%,调用减少31.9%,重复读取减少35.1%。ablation显示治理路径主要提升解决率,信息路径优化效率,两者结合效果最佳。这些结果验证了Ledger在长时程任务中的优越性能。
应用场景
该机制适用于自动化软件修复、代码生成、持续集成等场景,特别是在需要多轮交互和状态追踪的复杂任务中。通过机械化维护执行状态,减少重复劳动,提高成功率,降低成本。未来可结合多模态数据和学习机制,扩展至更复杂的工业应用,推动AI在软件工程中的智能化发展。
局限与展望
Ledger依赖于命令和观察的机械记录,可能在高频变更或复杂操作中出现状态滞后或误判,影响效果。对极端动态环境的适应性有限,未来需优化账本同步和容错机制。此外,当前未考虑多代理协作场景,未来需扩展多主体状态同步,提升系统鲁棒性。
通俗解读 非专业人士也能看懂
想象你在厨房里做饭,每次你都把用过的锅碗瓢盆放到一边,记住哪些已经洗干净,哪些还需要洗。这样,当你下一次需要用锅时,你可以直接知道哪些是干净的,不用重复洗。同样,Ledger就像这个厨房的记账本,记录你做饭的每一步:你用过的锅、洗过的碗、还在用的食材。每次你准备下一步时,它会帮你看看哪些东西还可以用,哪些需要重新准备。这样就避免了重复劳动,也让整个厨房变得井井有条。它让AI代理像个聪明的厨师,知道自己做过什么,还剩什么可以用,不会白费力气重复之前的工作。这个机制让工作变得更快、更省力,也更可靠。
原文摘要
Long-horizon coding agents accumulate hundreds of actions and observations in their trajectories, yet nothing in this record indicates which observations still describe the repository as it currently stands. Before every decision, the model must implicitly infer the execution status from raw history, and when this inference falls short, the agent acts on outdated file contents or re-executes work whose results are still valid. We propose Ledger, a deterministic runtime layer that distills an agent's completed interactions into an explicit execution state: what has been observed, what has been modified, and what has been attempted. Ledger keeps this state in an online execution ledger and applies it at two boundaries of every step. Before the model acts, an inform path appends a compact runtime state view to the prompt; before a proposed command runs, a govern path checks it against the ledger, returning still-valid earlier results in place of re-execution and flagging likely-redundant repetition. The layer adds no language-model calls and wraps an otherwise unmodified agent. Across all 500 SWE-bench Verified instances, Ledger raises Pass@1 from 56.2% to 64.2% with GPT-5 mini and from 75.8% to 81.0% with MiniMax M2.5, while cutting total cost by 28.9% and 31.8%. Attached to OpenAI Codex, it adds 3.4 percentage points of Pass@1 at 24.4% lower cost. Ablations attribute most of the resolution gain to govern and most of the efficiency gain to inform, with their combination performing best. What long-horizon agents lack, we conclude, is not a shorter view of their history but an explicit account of their own execution state.