StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments

TL;DR

StarHarness通过分层搜索在企业环境中演化固定模型权重的任务调度框架,提升性能20-35个百分点。

cs.AI 🔴 高级 2026-08-26 72 次浏览
Esakkivel Esakkiraja Denis Akhiyarov Vikas Yadav Sai Rajeswar Patrice Bechard Sridhar Nemala Sagar Davasam
AI代理 任务调度 企业环境 模型微调 策略演化

核心发现

方法论

StarHarness采用分层搜索策略,通过将任务按照失败行为进行划分,构建紧凑的演化池。其核心包括:分离可见搜索任务与隐藏选择任务,保留未见任务用于泛化评估。利用基于失败模式的任务分层,结合树搜索与爬山算法,优化任务调度策略,保持模型权重不变。演化流程包括提案、验证、评估三个阶段,利用持久存储追踪候选修正,确保搜索的有效性与可逆性。该方法在ITBench SRE、EnterpriseOps-Gym ITSM及AutomationBench Finance上实现了20-35个百分点的性能提升,且迁移到未参与演化的任务和不同模型(GPT、Qwen)时仍保持优越表现。

关键结果

  • 在ITBench SRE中,演化后任务成功率从40%提升至75%,减少了25个交互步骤,成本降低17%。
  • EnterpriseOps-Gym中,任务成功率由23.3%提升至43.7%,工具调用次数减半,成本降低53%。
  • AutomationBench中,任务得分由57.1%提升至83.2%,减少了4.37轮交互,guardrail违规显著减少,从20降至4。

研究意义

该研究突破了模型固定情况下的环境适应能力瓶颈,通过系统化的任务调度策略演化,有效缓解了模型与复杂企业环境之间的匹配问题。其方法不仅提升了任务完成率,还改善了操作效率和安全性,为企业级AI代理的实用化提供了新路径。此技术可广泛应用于IT运维、财务自动化等领域,推动企业智能化水平的提升。研究强调模型与调度策略的协同优化,为未来大规模企业AI系统的设计提供理论基础。

技术贡献

StarHarness提出了一套基于分层搜索的任务调度演化框架,结合失败行为划分、任务隔离和持久存储机制,有效缩短搜索路径。其核心创新在于:1)引入失败模式划分,提升搜索效率;2)采用树搜索与爬山结合的混合策略,平衡探索与利用;3)设计任务划分与保留未见任务的机制,实现良好的泛化能力。该方法在保持模型权重不变的基础上,通过外部调度策略实现性能提升,突破了传统微调的局限。

新颖性

本研究首次系统性引入分层任务划分与外部调度优化策略,专注于在模型权重固定条件下实现环境适应。不同于以往仅通过微调模型参数,StarHarness利用任务失败行为进行策略演化,显著提升了模型在复杂企业环境中的表现。其结合树搜索与爬山技术,提供了高效的搜索路径压缩方案,具有较强的创新性和实用价值。

局限性

  • 该方法依赖于任务失败行为的准确划分,若失败模式不明确或变化频繁,演化效果可能受限。
  • 演化过程在大规模任务集上可能面临计算成本较高的问题,尤其在多模型迁移时需要多次验证。
  • 目前主要在企业环境模拟数据上验证,实际部署中可能需考虑环境动态变化和安全风险。

未来方向

未来将探索联合演化模型权重与调度策略的强化学习方法,以实现更深层次的环境适应。同时,结合元学习技术提升泛化能力,并在真实企业系统中进行长周期测试,验证其稳定性和实用性。还将研究多模型协同演化策略,推动企业AI代理的自主学习与优化。

AI 总览摘要

在企业环境中,AI代理面临复杂多变的工具接口、环境约束和操作知识的挑战。传统方法多依赖模型微调,难以应对环境变化带来的性能瓶颈。StarHarness提出了一种创新的任务调度演化框架,通过分层搜索策略,有效提升固定模型在企业任务中的表现。该方法将任务按照失败行为进行划分,构建紧凑的演化池,结合树搜索与爬山算法,优化调度策略,显著改善了IT运维、财务自动化等场景中的任务成功率和效率。实验结果显示,演化后性能提升20-35个百分点,且迁移到未参与演化的任务和不同模型时仍保持优越。分析表明,界面修复、环境约定和操作知识的引入,极大压缩了搜索空间,减少了误诊和交互轮次。该技术为企业级AI代理提供了实用的环境适应方案,推动了模型与环境协同优化的研究方向。未来,结合强化学习实现模型与调度的联合演化,有望进一步提升企业AI的自主学习能力和部署效率。

深度分析

研究背景

随着大规模语言模型(LLM)在自动化和智能决策中的应用不断扩大,企业环境中的AI代理逐渐成为研究热点。早期工作如GPT-4的应用主要集中在单任务微调,但在复杂多变的企业场景中,模型面临环境适应性不足的问题。近年来,调度策略优化、提示工程和微调方法不断发展,代表性工作包括Meta-Harness、Prompt Tuning等,旨在提升模型在特定任务中的表现。然而,这些方法多依赖模型参数调整,难以应对环境变化带来的持续挑战。企业环境中的任务具有状态依赖、工具接口复杂、操作知识丰富等特点,传统微调难以全面适应。为此,研究逐步转向外部调度策略、任务划分和策略演化,以提升模型在实际应用中的鲁棒性和效率。

核心问题

企业环境中的AI代理需要在复杂的工具接口、多样的任务场景下保持高效表现。现有微调方法难以快速适应环境变化,且调度策略的设计缺乏系统性,导致模型与环境出现持续偏差。具体瓶颈包括:任务调度缺乏系统化划分、搜索空间庞大导致效率低下、模型微调成本高且难以迁移。如何在保持模型固定的基础上,通过调度策略的优化实现环境适应,成为亟待解决的问题。这不仅关系到企业自动化的效率,也影响到模型的安全性和稳定性。

核心创新

StarHarness的核心创新在于:1)引入基于失败行为的任务分层,将任务划分为不同失败模式,提升搜索效率;2)结合树搜索与爬山算法,平衡探索与利用,优化调度路径;3)设计任务划分与未见任务保留机制,增强模型的泛化能力。这些创新使得调度策略在保持模型权重不变的前提下,有效适应不同企业环境。其独特之处在于:通过外部调度器对任务调度进行系统化演化,减少了微调的复杂性和成本,为企业AI代理提供了更灵活的解决方案。

方法详解

  • �� 任务划分:基于失败模式、任务得分和验证通过率,将任务划分为搜索集、选择集和未见集。• 构建演化池:从全部任务中采样,确保失败行为分布均衡,避免过拟合。• 搜索策略:采用树搜索探索多假设路径,结合爬山算法进行局部优化。• 迭代演化:在提案、验证、评估三阶段循环中,利用持久存储追踪候选修正,确保搜索的连续性。• 保护机制:限制候选变更范围,避免硬编码答案或任务特定信息。• 评估:在未见任务上进行最终验证,确保泛化能力。• 迁移:在不同模型(GPT、Qwen)上测试演化效果,验证迁移能力。

实验设计

采用ITBench SRE、EnterpriseOps-Gym和AutomationBench三大企业场景,分别测试根因分析、ITSM流程和财务自动化任务。对比默认调度策略与演化策略的性能差异,指标包括任务成功率、交互轮次、成本和误诊率。使用GPT-5.4(中等推理能力)作为基础模型,结合不同模型(Qwen3.6、GPT-5.5)进行迁移验证。超参数包括:演化轮次(4-12次)、任务划分比例(约50%)、搜索深度。还设计了消融实验,验证失败行为划分和搜索策略的贡献。

结果分析

演化后,ITBench成功率由40%提升至75%,成本降低17%;EnterpriseOps-Gym成功率由23.3%提升至43.7%,工具调用次数减半,成本降低53%;AutomationBench得分由57.1%提升至83.2%,轮次减少4.37,guardrail违规显著下降。迁移测试中,模型从Qwen3.5到GPT-5.5的性能提升均在20-45个百分点,验证了策略的泛化能力。分析显示,界面修复、环境约定和操作知识的引入,是性能提升的关键因素。

应用场景

该方法适用于企业IT运维、财务自动化、客户服务等场景,能显著提升任务完成效率和安全性。企业可通过外部调度策略快速适应环境变化,减少微调成本。未来,结合强化学习实现调度与模型的联合演化,将推动企业AI系统的自主学习和持续优化,助力企业数字化转型。

局限与展望

当前方法依赖于失败行为的准确划分,若环境变化频繁或失败模式模糊,效果可能受影响。演化过程计算成本较高,尤其在多模型迁移时需要多次验证。实际部署中,环境动态变化和安全风险未充分考虑,未来需结合在线学习和安全机制进行优化。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,面对不同菜谱和食材,如何用同一套工具做出不同菜肴?传统方法就像每次都重新调试厨具和菜谱,而StarHarness像是提前准备好一套调味料和步骤,能根据不同菜肴自动调整。它通过观察失败的原因,优化调料和步骤,让厨具更聪明,做饭更快更好。这样,即使换菜谱,也不用重新调试,只需少量调整,就能做出满意的菜肴。这就像给厨房装上智能调度系统,让厨师(模型)在不同菜系中游刃有余,效率大大提升。

简单解释 像给14岁少年讲一样

想象你在学校里玩一个游戏,你的目标是完成各种任务,比如解谜、答题或建造东西。刚开始,你用的工具(比如笔、尺子)都一样,但每次遇到不同的任务时,你会发现有些工具用得不好,或者需要调整。StarHarness就像是给你一套特别的工具箱,它会观察你做任务时遇到的问题,然后自动帮你调整工具,比如换个尺子、加个夹子,让你更快完成任务。它还会记住哪些调整效果最好,下次遇到类似问题时就能直接用。这样一来,你就不用每次都从头调工具,任务完成得更快、更顺利。这个方法让你的工具箱变得更聪明,帮你轻松应对各种挑战。

术语表

分层搜索 (Stratified Search)

一种根据任务失败行为将搜索空间划分为不同层次的方法,以提高搜索效率。

用于任务调度策略的优化过程。

任务划分 (Task Partitioning)

将任务按照失败模式和性能指标划分为不同子集,便于有针对性地优化。

在演化过程中实现任务的系统化管理。

调度策略 (Scheduling Strategy)

控制任务执行顺序和资源分配的规则,用于提升整体效率。

在调度演化中核心优化目标。

模型迁移 (Model Transfer)

将经过调优的调度策略应用到不同模型或任务中,验证其泛化能力。

验证策略的实用性和普适性。

失败行为 (Failure Mode)

模型在任务中表现不佳的具体原因,如工具调用错误或环境不匹配。

任务划分和策略优化的基础。

开放问题 这项研究留下的未解疑问

  • 1 如何在动态变化的企业环境中持续维护和更新调度策略?
  • 2 多模型协同调度的有效机制尚未成熟,未来需要研究更高效的联合优化方法。

应用场景

近期应用

企业IT运维自动化

通过调度优化提升故障诊断和修复效率,减少人工干预,降低成本。

远期愿景

自主企业AI系统

实现模型与调度策略的联合自我优化,推动企业智能化全面升级,减少人力依赖。

原文摘要

We present StarHarness, a framework for evolving environment-specific agent harnesses while keeping model weights fixed. The evolved harness can include prompt and task framing, tool interfaces, skills, MCP-backed providers, subagent structure, and agent-loop configuration. StarHarness constructs a compact evolution pool by stratifying tasks according to baseline failure behavior, separates proposer-visible search tasks from proposer-hidden selection tasks, and reserves held-out tasks for evaluating generalization. Across ITBench SRE, EnterpriseOps-Gym ITSM, and AutomationBench Finance, harness evolution improves full-benchmark performance by 20-35 percentage points over the default harness after 4-12 accepted changes per environment. These gains persist on tasks excluded from evolution and transfer without re-evolution across GPT and Qwen model families. Trace analysis links the improvements to interface repairs, environment conventions, and operational knowledge that compresses search, with fewer false-positive diagnoses and shorter trajectories in several settings. StarHarness therefore offers a practical way to reduce persistent model-environment mismatch in tool-rich enterprise tasks.

cs.AI cs.SE