Dr. Zero: Self-Evolving Search Agents without Training Data

TL;DR

Dr. Zero通过自我进化和HRPO算法,在无训练数据下实现了与监督学习相媲美的搜索能力。

cs.AI 🔴 高级 2026-01-12 31 次浏览
Zhenrui Yue Kartikeya Upasani Xianjun Yang Suyu Ge Shaoliang Nie Yuning Mao Zhe Liu Dong Wang
自我进化 搜索代理 无监督学习 Hop-grouped相对策略优化 大语言模型

核心发现

方法论

Dr. Zero通过一个自我进化反馈循环,利用外部搜索引擎作为知识环境。提出者生成多样化问题,解答者解决问题并反馈难度,形成自动化课程。HRPO算法通过分组相似问题,减少计算成本。

关键结果

  • Dr. Zero在多个问答基准上超过了监督学习代理,如在NQ上达到0.397的精确匹配分数,比监督基线高22.9%。
  • 在多跳任务中,Dr. Zero的7B模型在2WikiMQA上表现优于监督基线,显示出强大的推理能力。
  • HRPO显著减少了计算需求,使得Dr. Zero在无训练数据下实现了高效的自我进化。

研究意义

Dr. Zero展示了在无人工标注数据情况下,通过自我进化实现强大搜索和推理能力的可能性。这一研究突破了数据瓶颈,为大规模语言模型的自动化学习提供了新路径,具有重要的学术和工业意义。

技术贡献

Dr. Zero引入了Hop-grouped相对策略优化(HRPO),通过问题结构分组,降低了训练计算成本。此外,提出的自我进化框架无需人工标注数据,展示了新的工程可能性。

新颖性

Dr. Zero首次在无训练数据的情况下,通过自我进化和HRPO实现了与监督学习相当的性能,特别是在复杂的多跳推理任务中。

局限性

  • Dr. Zero在处理极端复杂问题时可能面临性能下降,因为这些问题需要更多的计算资源和更复杂的推理。
  • 该方法依赖于外部搜索引擎的质量和覆盖范围,可能导致知识盲区。

未来方向

未来可以探索如何在更广泛的知识领域中应用Dr. Zero,并优化其在极端复杂任务中的性能。此外,结合其他无监督学习方法可能进一步提升其能力。

AI 总览摘要

随着高质量数据的获取变得愈发困难,自我进化成为了一种有前景的范式。Dr. Zero通过一个自我进化反馈循环,利用外部搜索引擎作为知识环境,提出者生成多样化问题,解答者解决问题并反馈难度,形成自动化课程。为了提高训练效率,研究引入了Hop-grouped相对策略优化(HRPO),通过分组相似问题,减少计算成本。实验结果表明,Dr. Zero在多个问答基准上超过了监督学习代理,展示了在无人工标注数据情况下,通过自我进化实现强大搜索和推理能力的可能性。这一研究突破了数据瓶颈,为大规模语言模型的自动化学习提供了新路径,具有重要的学术和工业意义。然而,Dr. Zero在处理极端复杂问题时可能面临性能下降,因为这些问题需要更多的计算资源和更复杂的推理。未来可以探索如何在更广泛的知识领域中应用Dr. Zero,并优化其在极端复杂任务中的性能。此外,结合其他无监督学习方法可能进一步提升其能力。

深度分析

研究背景

近年来,随着大语言模型(LLM)的发展,如何在无人工标注数据的情况下实现自动化学习成为研究热点。传统方法依赖于大量人工标注数据,导致数据获取成本高昂且难以扩展。自我进化方法通过生成和解决问题,实现模型能力的自动提升,已在数学和特定推理任务中取得一定进展。

核心问题

多轮搜索代理在无训练数据的情况下难以有效自我进化,主要因为问题多样性有限和多步推理计算成本高。如何在不依赖人工标注数据的情况下,提高搜索代理的推理能力是一个重要且具有挑战性的问题。

核心创新

Dr. Zero引入了一个自我进化反馈循环,提出者生成多样化问题,解答者解决问题并反馈难度,形成自动化课程。此外,HRPO通过分组相似问题,降低了计算成本。这些创新使得Dr. Zero在无训练数据的情况下实现了高效的自我进化。

方法详解

  • �� 提出者生成多样化问题,利用外部搜索引擎作为知识环境。
  • �� 解答者解决问题并反馈难度,形成自动化课程。
  • �� HRPO通过分组相似问题,减少计算成本,提高训练效率。
  • �� 通过多轮迭代,逐步提高提出者和解答者的能力。

实验设计

实验在多个开放域问答基准上进行,包括NQ、TriviaQA、PopQA等。使用Qwen2.5 3B/7B模型作为基础,评估Dr. Zero与监督学习基线的性能差异。关键指标包括精确匹配分数,实验结果显示Dr. Zero在无训练数据情况下超过了多个监督基线。

结果分析

Dr. Zero在多个问答基准上超过了监督学习代理,如在NQ上达到0.397的精确匹配分数,比监督基线高22.9%。在多跳任务中,Dr. Zero的7B模型在2WikiMQA上表现优于监督基线,显示出强大的推理能力。

应用场景

Dr. Zero可以用于需要复杂推理和搜索能力的应用场景,如自动问答系统、智能助手等。这些应用无需依赖人工标注数据,降低了开发成本,具有广泛的行业影响。

局限与展望

Dr. Zero在处理极端复杂问题时可能面临性能下降,因为这些问题需要更多的计算资源和更复杂的推理。此外,该方法依赖于外部搜索引擎的质量和覆盖范围,可能导致知识盲区。

通俗解读 非专业人士也能看懂

想象一个学校,老师是提出者,学生是解答者。老师每天给学生出不同难度的题目,学生尝试解答并反馈难度。老师根据反馈调整题目难度,逐步提高学生的能力。Dr. Zero就像这样的学校,通过自我进化,不断提升自身的搜索和推理能力。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,游戏里有个机器人助手。这个助手会给你出各种谜题,你要去网上找答案。每次你解对了,助手就会给你更难的题目。这个助手就像Dr. Zero,通过不断给自己出题,变得越来越聪明!

术语表

自我进化 (Self-Evolution)

指模型通过生成和解决问题,不断提升自身能力的过程。

Dr. Zero通过自我进化实现了无监督学习。

Hop-grouped相对策略优化 (HRPO)

一种通过分组相似问题,降低训练计算成本的优化算法。

HRPO在Dr. Zero中用于提高训练效率。

提出者 (Proposer)

负责生成多样化问题的模型组件。

在Dr. Zero中,提出者生成问题以训练解答者。

解答者 (Solver)

负责解决问题并反馈难度的模型组件。

解答者通过解决问题,帮助提出者调整问题难度。

外部搜索引擎 (External Search Engine)

用于提供知识环境的工具,帮助模型获取外部信息。

Dr. Zero利用外部搜索引擎作为知识环境。

开放问题 这项研究留下的未解疑问

  • 1 如何在更广泛的知识领域中应用Dr. Zero仍需探索,特别是在处理极端复杂任务时。
  • 2 如何进一步优化Dr. Zero在无监督学习中的性能,特别是在多跳推理任务中。

应用场景

近期应用

自动问答系统

Dr. Zero可以用于开发无需人工标注数据的自动问答系统,降低开发成本。

远期愿景

智能助手

通过自我进化,Dr. Zero可以成为更智能的助手,处理复杂的搜索和推理任务。

原文摘要

As high-quality data becomes increasingly difficult to obtain, self-evolution without curated training data has emerged as a promising paradigm. This approach allows large language models (LLMs) to autonomously generate and solve complex problems, thereby improving their reasoning capabilities. However, multi-turn search agents struggle in this setting due to limited question diversity and the substantial compute required for multi-step reasoning and tool use. In this work, we introduce Dr. Zero, a framework that enables search agents to effectively self-evolve without human-annotated training data, relying solely on an external search engine as their knowledge environment. In particular, we design a self-evolution feedback loop where a proposer generates structurally diverse questions to train a solver initialized from the same base model. As the solver evolves, it incentivizes the proposer to produce increasingly difficult yet solvable tasks, thus establishing an automated curriculum to refine both agents. To enhance training efficiency, we also introduce hop-grouped relative policy optimization (HRPO). This method clusters structurally similar questions to construct group-level baselines, effectively minimizing the sampling overhead in evaluating each query's individual difficulty and solvability. Consequently, HRPO significantly reduces the compute requirements for proposer training and reward estimation without compromising performance or stability. Extensive experimental results demonstrate that Dr. Zero matches or surpasses fully supervised search agents on several question answering benchmarks, showing that strong agentic search and evidence-grounded reasoning can emerge solely through self-evolution.

cs.AI