Recursive Harness Self-Improvement

TL;DR

提出递归自我提升的RHI方法,通过少量迭代优化用户构建的任务特定harness,显著提升低推理成本代理性能,减少推理成本达60%。

cs.LG 🔴 高级 2026-07-17 6 引用 55 次浏览
Hyunin Lee Jinglue Xu Jeffrey Seely Donghyun Lee Matei Zaharia Yujin Tang
自我改进 模型- harness共进化 少样本优化 信息论 持续学习

核心发现

方法论

本文提出的Recursive Harness Self-Improvement(RHI)将harness定义为代理循环的提示层描述,通过迭代利用自身修订历史中的成对反馈进行优化。RHI采用轨迹局部的目标函数,将竞争分布限制在前一轮的harness上,避免全局搜索的高昂成本。具体机制包括:• 将harness作为prompt级别的描述,避免执行代码的复杂性;• 利用成对偏好反馈,逐步引导harness向更优方向演进;• 通过缓存前一轮输出,极大降低每次迭代的计算成本;• 采用信息论假设,解释RHI的隐式优化目标为最大化任务相关信息流,最小化冗余。实验中,RHI在30个合成机器学习任务中表现优异,显著超越最大推理努力设置,提升性能上限,同时推理成本降低达60%。

关键结果

  • 在30个合成机器学习任务中,经过少量(2-3次)RHI迭代,低推理成本代理的性能提升超过20%,超越对应最大推理努力模型,且推理成本降低达60%。例如,在量化金融、机器人和药学任务中,RHI显著改善任务相关的上下文管理和信息流,提升代码生成和推理效率。
  • RHI的性能提升主要源于更有效的跨代理信息流和任务相关上下文优化,而非延长推理链条。实验数据显示,输出令牌数几乎不变,缓存读写和推理成本反而降低,验证了其在信息组织和冗余减少方面的优势。
  • 通过信息论分析,论文提出RHI的隐式目标是最大化组件间的互信息,减少冗余信息,从而实现高效的任务适应性和持续学习能力。这一理论模型为未来的模型- harness共进化提供了新的理解框架。

研究意义

该研究突破了传统依赖预定义、昂贵且难以持续更新的harness设计瓶颈,提出了轻量级、少样本、任务定制的优化策略,为模型- harness共进化提供了实用算法。通过在多任务环境中验证,RHI展现出在提升模型推理能力、降低成本和增强任务适应性方面的巨大潜力。其核心思想是利用有限的偏好反馈,逐步引导harness向更优的配置演进,从而实现持续学习和自我提升。这不仅丰富了模型调优的理论体系,也为工业界的自动化、个性化定制提供了技术基础。

局限性

  • 目前RHI在高维复杂任务中的表现仍需验证,尤其是在多模态、多任务场景下的泛化能力有限。其隐式目标依赖偏好反馈的准确性,可能受到偏差和噪声影响,导致优化方向偏离最优。
  • 算法在极端任务或极大规模模型中可能面临计算瓶颈,尤其是在需要频繁缓存和成对比较的情况下,成本可能上升。此外,当前方法主要在合成任务中验证,实际应用中的鲁棒性和稳定性尚待进一步验证。
  • 未来需要结合更强的理论分析和多样化的实验验证,探索在真实工业场景中的适应性、扩展性和鲁棒性,同时优化算法的效率和稳定性。

未来方向

未来工作将聚焦于:• 扩展RHI在多模态、多任务、多语言环境中的适应性,验证其在实际工业应用中的效果;• 结合强化学习和自监督机制,提升偏好反馈的质量和鲁棒性;• 探索更深层次的信息论模型,理解和优化RHI的隐式目标,增强其持续学习能力;• 开发高效的实现框架,降低大规模场景下的计算成本,推动其在自动化、个性化服务中的应用。

AI 总览摘要

在人工智能的快速发展中,模型规模的扩展、训练计算的增加以及后训练优化技术的提升共同推动了性能的飞跃。然而,近年来的研究逐渐认识到,模型与其使用的harness(支架)之间的协同演化在性能提升中扮演着关键角色。传统的harness设计多依赖于预定义的静态结构,难以适应多样化任务和不断变化的应用需求,且更新成本高昂,限制了持续学习的可能性。

本文提出了一种创新的自我提升机制——递归自我提升(Recursive Harness Self-Improvement, RHI),旨在通过少量迭代、轻量级的优化,提升用户自定义harness的性能,从而改善代理的任务执行质量。RHI将harness定义为任务提示(prompt)级别的描述,包括角色分配、指令、信息交换协议和工作流程结构。通过利用成对偏好反馈,RHI在每次迭代中仅与前一轮的harness进行比较,逐步引导harness向更优配置演进。这一策略有效避免了全局搜索的高昂成本,显著降低了每次优化的计算负担。

在30个合成机器学习任务中,RHI展现出卓越的性能。结果显示,经过2-3轮迭代,低推理成本的代理不仅超越了对应最大推理努力模型的性能,还在推理成本方面节省了多达60%。这些提升主要源于更高效的任务上下文管理和信息流优化,而非简单延长推理链条。具体表现为输出令牌数几乎不变,缓存读写和推理成本反而降低,验证了RHI在信息组织和冗余减少方面的优势。

此外,论文通过信息论分析,提出RHI的隐式目标是最大化组件间的互信息,减少冗余信息,从而实现高效的任务适应性和持续学习能力。这一理论模型为理解RHI的优化机制提供了新的视角,也为未来模型- harness共同演化的研究提供了基础。

总之,RHI代表了一种轻量级、可扩展的自我优化策略,为模型在多任务、多场景中的持续学习和自我提升提供了可行路径。未来,结合多模态、多任务环境的验证,以及强化学习等技术,RHI有望在工业自动化、个性化服务等领域发挥更大作用,推动人工智能的持续创新与应用普及。

深度分析

研究背景

近年来,人工智能领域的快速发展主要依赖于模型规模的不断扩大、训练数据的丰富以及后训练调优技术的提升(如微调、强化学习等)。代表性工作包括GPT系列、BERT、T5等模型的突破,推动了自然语言处理、计算机视觉等多个子领域的飞跃。然而,模型性能的提升逐渐遇到边界,单纯依赖模型规模的扩展成本高昂,难以持续。与此同时,模型- harness的协同演化被逐步认识到其在性能提升中的关键作用。现有的harness设计多为预定义静态结构,难以适应多样化任务,且更新繁琐,限制了持续学习的能力。近年来,研究者开始探索基于偏好反馈、自动化优化的harness演化方法,但大多依赖昂贵的全局搜索或复杂的代码生成,难以在实际应用中推广。

核心问题

核心问题在于如何在有限的计算资源下,通过少量迭代、任务定制的方式,优化用户构建的harness以生成更高质量的任务执行轨迹。传统方法依赖全局搜索或大规模的候选集评估,成本高昂且难以持续。尤其在多任务、多场景的实际应用中,昂贵的评估成本成为瓶颈。此外,现有的优化策略难以兼顾效率与效果,导致难以实现持续学习和自我提升。如何设计一种低成本、快速收敛、适应多样任务的harness优化机制,成为亟待解决的问题。

核心创新

本研究的核心创新在于提出递归自我提升(RHI)框架,• 将harness定义为提示级别的描述,避免复杂的代码执行;• 利用成对偏好反馈,逐步引导harness向更优配置演进;• 采用轨迹局部的目标函数,将竞争分布限制在前一轮harness上,降低计算成本;• 通过缓存前一轮输出,极大减少每次迭代的执行和评估开销;• 引入信息论假设,解释优化目标为最大化组件间的互信息,减少冗余信息。这些创新使得优化过程既高效又具备持续学习能力,突破了传统全局搜索的局限。

方法详解

  • �� 将harness作为prompt级别的描述,定义角色、指令、信息交换和工作流程;• 设计轨迹局部的目标函数,将竞争范围限定在前一轮的harness,避免全局搜索;• 利用成对偏好反馈,逐步优化harness,形成递归自我提升循环;• 每次迭代中,缓存前一轮输出,减少重复执行成本;• 通过偏好历史,指导下一轮harness的生成,确保优化方向;• 引入信息论模型,最大化组件间的互信息,减少冗余信息流,提升任务相关性;• 采用LLM作为偏好评估器和harness优化器,实现端到端的自动化优化流程。

实验设计

实验在30个合成机器学习任务中进行,涵盖量化金融、机器人和药学等领域。每个任务要求生成完整的代码仓库,评估指标采用成对偏好比较,确保多维评价的合理性。模型基础包括Sonnet-4.6、Opus-4.7和Opus-4.8,验证不同模型规模下RHI的效果。对比基线包括最大推理努力(max)、超高推理(xhigh)和超代码(ultracode)等测试时间尺度。每个任务进行2-3轮RHI迭代,观察性能变化和推理成本变化。还进行了消融实验,验证偏好反馈、缓存机制和信息论假设对性能的贡献。

结果分析

结果显示,经过少量(2-3次)RHI迭代,低推理成本代理的性能提升超过20%,超越对应最大推理努力模型,且推理成本降低达60%。在30个任务中,RHI的胜率明显高于所有测试尺度的基线,表现出优越的任务适应性和效率。性能提升主要源于更高效的上下文管理和信息流优化,而非输出长度增加。偏好反馈引导的优化策略使得模型在保持输出质量的同时,显著减少冗余信息和计算成本。这一结果验证了信息论假设的有效性,为未来优化提供理论基础。

应用场景

该方法适用于自动代码生成、任务调度、多轮对话系统等场景,特别是在资源有限、需要快速适应多样任务的工业应用中。通过少量迭代实现模型的持续自我提升,降低了维护成本,增强了系统的个性化和鲁棒性。未来可结合自动化调优平台,推广到多模态、多任务的复杂环境中,推动智能系统的自主学习和适应能力。

局限与展望

当前RHI在极端复杂任务和多模态场景中的表现仍需验证,偏好反馈的质量可能受到噪声影响,导致优化偏离最优。算法在大规模模型和多任务环境下的计算成本仍存在挑战,尤其是在频繁缓存和成对比较的情况下。此外,隐式信息论目标的理论模型还需进一步验证其在实际场景中的适用性和鲁棒性。未来需结合强化学习、多模态信息融合等技术,提升算法的泛化能力和效率。

通俗解读 非专业人士也能看懂

想象你在一家厨房里做饭。每次你尝试做一道菜,味道可能不够好,于是你会根据尝试的结果调整配料和步骤。这个过程不断重复,每次都根据上次的经验做出改进。现在,把这个厨房比作一个智能助手,它在帮你写代码或解决问题。每次它完成一部分任务后,你会告诉它“这个做得不错”或者“还可以更好”,它会根据你的反馈调整下一次的操作。这个方法就像在厨房里不断试错和改进,逐渐做出更美味的菜肴。论文中的RHI就是让这个智能助手通过少量的反馈,逐步优化自己的工作流程和策略,从而变得越来越厉害,就像你在厨房里变成了大厨一样。它不需要每次都从头开始,而是利用之前的经验,快速学习和改进,节省时间和成本。这样,助手就能在不同的任务中表现得更好,帮你完成各种复杂的工作,就像一个不断学习、变得更聪明的厨师一样。

简单解释 像给14岁少年讲一样

想象你在学校里学习一门新技能,比如弹吉他。刚开始,你可能弹得不太好,音不准,节奏也不稳定。每次练习后,你的老师会告诉你哪里弹得好,哪里需要改进。你根据老师的反馈,调整你的手指位置和弹奏方式,反复练习。渐渐地,你变得越来越擅长弹奏,甚至可以即兴表演了。这就像在用反馈不断优化自己的技能。论文里的RHI方法也是这样,它让一个智能程序通过少量的反馈,逐步改进自己的“弹奏”方式——比如写代码或解决问题。每次它完成任务后,会根据“老师”的偏好反馈,调整下一次的策略。这样,程序不需要每次都从零开始,而是利用之前的经验,快速变得更厉害。这种方法特别适合在复杂、多变的任务中使用,可以让AI变得更聪明、更高效,就像你变成了弹吉他的高手一样。

术语表

Harness (支架)

在AI中,指用于引导模型执行任务的结构或框架,包括角色分配、指令、信息交换协议等。它是模型与任务交互的中介。

论文中将harness定义为代理循环的提示层描述,用于优化任务执行效果。

偏好反馈 (Preference Feedback)

一种通过比较两个输出的优劣,提供偏好信息的反馈机制,用于引导模型优化。它比单一指标更适合多维评价。

RHI利用偏好反馈进行逐步优化,避免了昂贵的全局搜索。

信息论 (Information Theory)

研究信息的量化、传输和编码的数学理论,核心概念包括互信息、熵等,用于分析模型信息流和冗余。

论文假设RHI的隐式目标是最大化组件间的互信息,减少冗余。

轨迹局部目标 (Trajectory-local Objective)

在优化中,将目标限制在当前状态与前一状态的局部比较,而非全局搜索,减少计算成本。

RHI采用轨迹局部目标,避免全局搜索带来的高昂成本。

模型-支架共进化 (Model-Harness Co-evolution)

模型与其引导框架(harness)相互演化、共同优化的过程,推动性能持续提升。

本文强调通过优化harness促进模型的持续学习。

成对偏好 (Pairwise Preference)

比较两个输出的优劣,形成偏好关系,用于多目标、多维评价中的排序和优化。

RHI利用成对偏好反馈引导harness优化。

持续学习 (Continual Learning)

模型在不断接收新信息和反馈中,逐步积累知识、优化性能的能力。

RHI为模型实现持续学习提供了新途径。

互信息 (Mutual Information)

衡量两个随机变量之间共享信息的量,越大表示越相关,越小则冗余越少。

论文假设RHI优化目标是最大化组件间的互信息。

开放问题 这项研究留下的未解疑问

  • 1 尽管RHI在合成任务中表现优异,但其在真实多模态、多任务环境中的适应性和鲁棒性仍未充分验证。未来需要在实际工业场景中测试其效果,特别是在复杂、多样的输入输出条件下的表现。
  • 2 偏好反馈的质量对优化效果影响显著,如何设计更鲁棒、抗噪声的偏好评估机制,是未来研究的关键。此外,偏好偏差和噪声可能导致优化偏离最优解,需引入更稳健的反馈机制。
  • 3 信息论模型虽提供理论基础,但在实际应用中如何准确估算和最大化互信息,仍面临计算复杂性和数据稀疏的问题。未来需结合近似算法和大规模信息估算技术。
  • 4 算法在极端大规模模型和多任务场景中的扩展性有限,尤其是在频繁缓存和成对比较的情况下,成本可能迅速上升。如何设计更高效的近似策略,是未来的重要方向。
  • 5 目前RHI主要在合成任务中验证,真实应用中的鲁棒性、稳定性和泛化能力仍需大量实证研究。未来应结合强化学习、多模态信息融合等技术,提升其适应性。

应用场景

近期应用

自动代码生成

利用RHI优化代码生成代理,使其在特定任务中快速适应不同的编程需求,降低调试和开发成本,提升自动化水平。

多轮对话系统

通过少量偏好反馈不断优化对话策略,提高系统的上下文理解和响应质量,增强用户体验。

任务调度与自动化

在工业自动化中,利用RHI优化调度策略和工作流程,提升效率和适应性,减少人工干预。

远期愿景

自主学习的智能系统

结合RHI实现模型的持续自我优化,打造具备自主学习能力的智能代理,广泛应用于自动驾驶、机器人等领域。

个性化定制AI助手

通过少量偏好反馈,快速定制符合个人需求的AI助手,实现个性化服务和定制化解决方案,推动智能生活普及。

原文摘要

Under model--harness co-evolution, harnesses are not merely inference-time scaffolds but data-generating components whose execution traces can shape future foundation models. This motivates harness-in-the-loop learning: optimizing harnesses for both immediate agent performance and the quality of traces used for future model training. However, continually updating provider-built scaffolds is costly and labor-intensive. We therefore investigate whether optimizing user-constructed harnesses in a task-specific manner can improve execution-trace quality while remaining computationally lightweight and requiring only a few update iterations. To this end, we introduce Recursive Harness Self-Improvement (RHI), which represents the harness as a prompt-level specification of the agent loop and iteratively refines it using pairwise feedback over its own revision history. Across 30 synthetic machine-learning research tasks spanning quantitative finance, robotics, and pharmacy, a few RHI iterations suffice to substantially raise the performance ceiling of low-reasoning-effort agents, exceeding the corresponding maximum-reasoning-effort setting while reducing inference cost by up to 60%. We show that these gains arise primarily from improved task-specific context management through more effective inter-agent information flow rather than longer reasoning traces. Finally, we formalize this behavior as an information-theoretic hypothesis for RHI's implicit optimization objective, suggesting RHI as a practical algorithm for continual learning within the paradigm of model--harness co-evolution.

cs.LG cs.AI

被引用 (6)

Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA

PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents

HELIX: Model-Harness Co-evolution for Recursive Self-Improvement

2026 1 引用 查看解读 →

From Prompt to Harness: Coderlet from Scratch