Yunjue Agent Tech Report: A Fully Reproducible, Zero-Start In-Situ Self-Evolving Agent System for Open-Ended Tasks

TL;DR

Yunjue Agent通过并行批次演化和工具自我优化,实现零起点的开放任务适应,性能超越基准模型。

cs.AI 🔴 高级 2026-01-26 34 次浏览
Haotian Li Shijun Yang Weizhen Qi Silei Zhao Rui Hua Mingzhu Song Xiaojian Yang Chao Peng
自我进化 工具优化 开放环境 零起点 多任务学习

核心发现

方法论

提出In-Situ Self-Evolving框架,将任务交互视为连续经验流,通过工具演化扩展能力。引入并行批次演化策略,优化工具生成与整合。

关键结果

  • 在DeepSearchQA上,Yunjue Agent实现73.5%的准确率,比Gemini 3 Pro高16.9个百分点。
  • 在xSciQA上,Warm-start设置下准确率从76.5%提升至80.2%,新工具合成减少100%。
  • 提出的EGL指标有效监控演化收敛,工具库在2500个查询后趋于稳定,仅生成97个新工具。

研究意义

该研究解决了传统代理系统在开放任务中的适应性不足问题,提供了一种无需监督的动态工具优化方法,为通用智能的实现奠定了基础。

技术贡献

首次提出并行批次演化策略,结合工具语义聚类与合并机制,显著提升工具库的效率与通用性。提出EGL指标,填补了演化收敛监控的空白。

新颖性

首次在零起点环境中实现动态工具演化,突破了传统依赖离线训练和固定工具集的局限。

局限性

  • 在极端任务分布漂移下,工具生成效率可能下降。
  • 当前系统对大规模并行任务的支持有限。
  • 工具库的长期存储和管理成本尚未优化。

未来方向

未来可探索更高效的工具语义聚类算法,以及在多模态任务中的适用性扩展。

AI 总览摘要

Yunjue Agent是一种全新设计的零起点自我进化代理系统,旨在解决开放任务环境中传统代理系统的适应性不足问题。通过In-Situ Self-Evolving框架,系统将任务交互视为连续经验流,动态优化工具库以应对新挑战。

核心技术包括并行批次演化策略和EGL收敛监控指标。并行批次演化通过工具语义聚类与合并机制,显著提升工具生成效率;EGL指标则提供了类似于训练损失的演化稳定性监控能力。

实验结果表明,Yunjue Agent在DeepSearchQA、xSciQA等五个基准数据集上均表现优异,尤其在零起点环境下显著超越现有基准模型。同时,Warm-start实验验证了工具库的跨领域迁移能力,展示了系统在新领域中的高效适应性。尽管如此,该系统在极端任务分布漂移和大规模任务并行处理方面仍有改进空间。

深度分析

研究背景

传统代理系统依赖静态工具集和离线训练,难以适应任务分布漂移和监督稀缺的开放环境。近年来,工具优化和自我进化成为解决这一问题的关键方向。

核心问题

如何在零起点环境中,通过动态工具演化实现代理系统的能力扩展,同时确保工具库的效率和通用性,是当前研究的核心难题。

核心创新

  • �� 提出In-Situ Self-Evolving框架,将任务交互转化为经验流。
  • �� 引入并行批次演化策略,通过工具语义聚类和合并优化工具生成。
  • �� 提出EGL指标,实时监控工具库的演化收敛。

方法详解

  • �� 系统由Manager、Tool Developer、Executor等模块组成。
  • �� 接收任务后,Manager从工具库中检索相关工具,必要时由Tool Developer生成新工具。
  • �� 并行批次演化通过工具聚类与合并,减少冗余并提升效率。
  • �� 使用EGL指标监控工具库的收敛状态。

实验设计

在HLE、DeepSearchQA、xSciQA等五个基准数据集上进行评估,比较零起点和Warm-start设置下的性能。实验使用准确率、工具生成数量和EGL变化作为关键指标。

结果分析

  • �� 在DeepSearchQA上,准确率提升至73.5%,超越基准模型。
  • �� 在xSciQA Warm-start设置下,准确率提升至80.2%,新工具生成减少100%。
  • �� 工具库在2500个查询后趋于稳定,仅生成97个新工具。

应用场景

适用于需要动态适应的开放任务场景,如多领域信息检索、复杂问题求解和跨学科研究。

局限与展望

系统在任务分布极端漂移和大规模并行任务处理方面的性能仍需优化。同时,工具库的长期管理成本可能成为瓶颈。

通俗解读 非专业人士也能看懂

想象一个厨师面对各种新菜谱,他需要不断发明新工具来完成烹饪任务。Yunjue Agent就像一个智能厨师助手,能够根据每道菜的需求自动设计、优化并保存新工具。比如,遇到需要切割特殊形状的蔬菜时,它会即时制造一个专用刀具,并在未来的类似任务中重复使用。

简单解释 像给14岁少年讲一样

想象你玩一个游戏,每次遇到新关卡时,你都能自己发明新道具来通关!Yunjue Agent就是这样的“游戏玩家”,它能在没有提示的情况下,自己想办法解决问题,还能把发明的道具存起来,以后用得上。是不是很酷?

术语表

In-Situ Self-Evolving (原地自我进化)

一种动态优化框架,将任务交互转化为经验流,持续更新工具库。

用于实现零起点环境下的能力扩展。

Parallel Batch Evolution (并行批次演化)

通过并行任务处理和工具聚类优化工具生成效率。

用于减少工具冗余并加速收敛。

EGL (演化通用性损失)

衡量工具库收敛状态的指标,类似于训练损失。

用于监控工具库的演化稳定性。

Tool Developer (工具开发模块)

负责根据任务需求生成新工具的系统模块。

在工具库中缺乏所需功能时调用。

HLE (Humanity’s Last Exam)

一个多学科基准数据集,用于评估高级推理能力。

用于测试系统在复杂任务中的表现。

开放问题 这项研究留下的未解疑问

  • 1 如何在大规模并行任务中进一步优化工具生成效率?
  • 2 如何降低工具库的长期存储和管理成本?

应用场景

近期应用

多领域信息检索

可动态生成工具完成跨领域信息查询和整合。

复杂问题求解

适用于科学研究和工程设计中的动态任务。

远期愿景

通用人工智能

推动实现能够自主适应的通用智能系统。

原文摘要

Conventional agent systems often struggle in open-ended environments where task distributions continuously drift and external supervision is scarce. Their reliance on static toolsets or offline training lags behind these dynamics, leaving the system's capability boundaries rigid and unknown. To address this, we propose the In-Situ Self-Evolving paradigm. This approach treats sequential task interactions as a continuous stream of experience, enabling the system to distill short-term execution feedback into long-term, reusable capabilities without access to ground-truth labels. Within this framework, we identify tool evolution as the critical pathway for capability expansion, which provides verifiable, binary feedback signals. Within this framework, we develop Yunjue Agent, a system that iteratively synthesizes, optimizes, and reuses tools to navigate emerging challenges. To optimize evolutionary efficiency, we further introduce a Parallel Batch Evolution strategy. Empirical evaluations across five diverse benchmarks under a zero-start setting demonstrate significant performance gains over proprietary baselines. Additionally, complementary warm-start evaluations confirm that the accumulated general knowledge can be seamlessly transferred to novel domains. Finally, we propose a novel metric to monitor evolution convergence, serving as a function analogous to training loss in conventional optimization. We open-source our codebase, system traces, and evolved tools to facilitate future research in resilient, self-evolving intelligence.

cs.AI