O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RL

TL;DR

O-Researcher通过多智能体蒸馏和强化学习生成高质量研究数据,显著提升开源LLM性能。

cs.CL 🔴 高级 2026-01-07 37 次浏览
Yi Yao He Zhu Piaohong Wang Jincheng Ren Xinlong Yang Qianben Chen Xiaowan Li Dingfeng Shi Jiaxian Li Qiexiang Wang Sinuo Wang Xinpeng Liu Jiaqi Wu Minghao Liu Wangchunshu Zhou
多智能体 强化学习 开源模型 数据生成 深度研究

核心发现

方法论

O-Researcher提出了一个多智能体协作框架,模拟复杂的工具集成推理流程,生成高质量的研究级数据。其训练策略包括两阶段:监督微调和基于Group Relative Policy Optimization (GRPO)的强化学习,优化模型对复杂任务的对齐和能力。

关键结果

  • 结果1:在Deep-Research-Bench上,O-Researcher-RL的RACE得分达到48.48,超过开源基线Tongyi-Deep Research (45.66)和闭源GPT-5 (46.77)。
  • 结果2:通过强化学习阶段,引用准确率从29.13%提升至31.99%,有效引用数从13.67提升至26.01。
  • 结果3:实验表明,采用10步推理流程的模型在综合性(49.61)和洞察力(48.71)上表现最佳。

研究意义

本研究为开源LLM提供了一种无需依赖专有数据的高效训练路径,显著缩小了与闭源模型在复杂推理任务上的性能差距。这对学术界和工业界的开源生态具有重要意义。

技术贡献

O-Researcher引入了多智能体协作生成高保真数据的框架,并通过GRPO强化学习优化模型的工具使用和推理能力。此外,提出了结构化数据表示和多阶段过滤策略,确保数据质量。

新颖性

该方法首次将多智能体协作与强化学习结合,用于生成研究级数据,并显著提升开源LLM在复杂推理任务中的表现。

局限性

  • 局限1:生成的研究数据在领域覆盖上可能存在偏差,影响模型的通用性。
  • 局限2:强化学习阶段的计算成本较高,限制了小型研究团队的使用。
  • 局限3:模型在极高复杂度任务上的表现仍有提升空间。

未来方向

未来可探索更高效的多智能体协作机制,扩展数据生成的领域覆盖,并优化强化学习的计算效率。

AI 总览摘要

当前开源大语言模型(LLMs)在复杂推理任务上的表现远逊于闭源模型,主要原因在于缺乏高质量的训练数据。O-Researcher通过多智能体协作生成研究级数据,并结合监督微调和强化学习策略,显著提升了开源模型的性能。

该方法采用多智能体框架,模拟复杂的工具集成推理流程,生成高保真、多样化的指令-响应对。通过两阶段训练策略,模型首先在合成数据上进行监督微调,建立知识基础;随后通过Group Relative Policy Optimization (GRPO)强化学习,进一步优化模型的工具使用和推理能力。

实验结果表明,O-Researcher在Deep-Research-Bench基准测试中取得了48.48的RACE得分,超越了现有开源和部分闭源模型。该研究为开源LLM提供了无需依赖专有数据的高效训练路径,具有广泛的学术和工业应用潜力,同时也为未来研究指明了方向。

深度分析

研究背景

近年来,大语言模型(LLMs)在自然语言处理领域取得了显著进展。然而,开源模型在复杂推理任务上的表现仍远逊于闭源模型,如GPT-4和Gemini-2.5。主要原因在于闭源模型拥有专有的高质量训练数据,而开源模型缺乏类似资源。

核心问题

核心问题是如何在不依赖专有数据的情况下,为开源LLM生成高质量、研究级的训练数据。这一问题的解决对提升开源模型的性能和推动AI民主化具有重要意义。

核心创新

O-Researcher的核心创新包括:


  • �� 多智能体协作框架:模拟复杂的推理流程,生成高保真数据。
  • �� GRPO强化学习:优化模型的工具使用和推理能力。
  • �� 数据质量保障:采用多阶段过滤和结构化数据表示,确保合成数据的高质量。

方法详解

方法包括以下步骤:


  • �� 数据生成:通过多智能体协作分解复杂任务,生成多轮对话数据。
  • �� 数据过滤:采用多阶段拒绝采样和人类验证,确保数据质量。
  • �� 监督微调:在合成数据上训练模型,建立知识基础。
  • �� 强化学习:通过GRPO优化模型的推理能力和输出质量。

实验设计

实验使用Deep-Research-Bench和DeepResearchGym基准测试,评估模型在科学、金融等领域的复杂推理能力。对比基线包括Tongyi-Deep Research和GPT-5。

结果分析

O-Researcher-RL在RACE得分上达到48.48,显著超越开源基线(45.66)。强化学习阶段提升了引用准确率(31.99%)和有效引用数(26.01)。

应用场景

该方法可应用于学术研究助手、企业决策支持系统和智能问答平台,帮助用户完成复杂的研究任务。

局限与展望

局限性包括领域覆盖的偏差、强化学习的高计算成本,以及在极高复杂度任务上的表现瓶颈。

通俗解读 非专业人士也能看懂

想象你在一个团队中完成复杂的研究项目。O-Researcher就像一个由多个专家组成的虚拟团队,每个专家负责不同的任务,比如查找资料、分析数据和撰写报告。通过协作,这些专家生成高质量的研究数据,并不断优化自己的工作流程。

简单解释 像给14岁少年讲一样

想象你和朋友们组队完成一个学校项目,每个人负责不同部分,比如查资料、写报告。O-Researcher就像一个超级聪明的AI团队,能快速分工合作,完成复杂任务,还能学会改进自己的方法!

术语表

多智能体协作

多个AI模型协同工作完成复杂任务的框架。

用于生成高质量研究数据。

GRPO

一种强化学习算法,用于优化模型的策略。

用于提升模型的推理能力。

RACE

一种评估报告质量的指标。

用于衡量模型在Deep-Research-Bench上的表现。

数据过滤

通过多阶段采样和验证确保数据质量的过程。

用于生成高保真训练数据。

结构化数据表示

以XML格式组织模型推理过程的方式。

用于训练模型的推理能力。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步扩展数据生成的领域覆盖?
  • 2 如何降低强化学习的计算成本?
  • 3 如何提升模型在极高复杂度任务上的表现?

应用场景

近期应用

学术研究助手

帮助研究人员快速完成文献综述和数据分析。

企业决策支持

为企业提供基于数据的深度分析和建议。

远期愿景

通用AI研究助手

实现能够独立完成复杂研究任务的通用AI。

原文摘要

The performance gap between closed-source and open-source large language models (LLMs) is largely attributed to disparities in access to high-quality training data. To bridge this gap, we introduce a novel framework for the automated synthesis of sophisticated, research-grade instructional data. Our approach centers on a multi-agent workflow where collaborative AI agents simulate complex tool-integrated reasoning to generate diverse and high-fidelity data end-to-end. Leveraging this synthesized data, we develop a two-stage training strategy that integrates supervised fine-tuning with a novel reinforcement learning method, designed to maximize model alignment and capability. Extensive experiments demonstrate that our framework empowers open-source models across multiple scales, enabling them to achieve new state-of-the-art performance on the major deep research benchmark. This work provides a scalable and effective pathway for advancing open-source LLMs without relying on proprietary data or models.

cs.CL cs.AI