Beyond Outcome Reward: Decoupling Search and Answering Improves LLM Agents

TL;DR

提出DeSA框架,通过两阶段训练分离搜索优化与答案生成,显著提升搜索召回率和问答准确率。

cs.AI 🔴 高级 2025-10-06 42 次浏览
Yiding Wang Zhepei Wei Xinyu Zhu Yu Meng
大型语言模型 强化学习 搜索优化 多任务学习 问答系统

核心发现

方法论

本文系统分析了仅用结果奖励训练的搜索代理的行为缺陷,发现其难以有效引导中间搜索行为。提出DeSA(Decoupling Search-and-Answering)框架,分为搜索技能学习(基于召回率奖励)和答案优化(基于结果奖励)两个阶段。采用Qwen2.5-3B/7B模型,结合GRPO算法,在七个问答基准上验证。第一阶段通过最大化检索召回,改善搜索行为;第二阶段利用精确匹配奖励优化答案生成。两阶段训练显著降低搜索缺陷率,提高搜索召回和最终问答准确性。

关键结果

  • DeSA将搜索缺陷率从23.36%降至6.96%,搜索召回率提升至64.5%,在七个问答数据集上平均提升8.0%的EM准确率,超越单阶段训练方法。
  • 在NaturalQuestions和HotpotQA上,DeSA在问答准确率和搜索效率方面均优于仅用结果奖励的基线,验证了分离训练的有效性。
  • 消除了重复查询、无效搜索等行为,增强了搜索的有效性和资源利用率,显著改善了最终答案的质量。

研究意义

该研究突破了传统单一奖励机制的局限,强调搜索行为的中间优化对提升大模型问答性能的关键作用。为未来构建更高效、可靠的搜索增强型LLMs提供了理论基础和实践路径,有望推动智能问答、知识检索等应用的深度发展。

技术贡献

提出两阶段分离训练框架DeSA,创新性地将搜索技能学习与答案优化解耦,利用召回率奖励指导搜索行为,结合结果奖励提升答案质量。采用GRPO算法确保训练稳定性,系统性分析了行为缺陷,并在多个问答任务中验证优越性能,推动了强化学习在搜索代理中的应用边界。

新颖性

首次系统性提出将搜索行为的中间优化与最终答案生成解耦,打破以结果奖励为唯一导向的传统训练范式,显著改善搜索效率和问答准确性,填补了该领域的研究空白。

局限性

  • 当前方法依赖预训练模型和外部检索系统,存在一定的计算成本和复杂度,未来需优化训练效率。
  • 在极端复杂或多模态任务中,搜索行为的优化仍面临挑战,模型泛化能力有待提升。
  • 对不同类型任务的适应性和迁移能力尚未充分验证,需进一步扩展多任务场景。

未来方向

未来将探索多阶段多任务训练策略,结合多模态信息增强搜索与推理能力,提升模型的通用性和鲁棒性。同时,研究更高效的奖励设计和自监督机制,减少对外部资源的依赖,推动大规模应用落地。

AI 总览摘要

随着大规模语言模型(LLMs)在知识获取和推理能力上的突破,搜索工具的结合成为解决知识截止和虚假信息的重要途径。然而,现有基于强化学习的搜索代理多采用单一的结果导向奖励(如精确匹配),试图通过优化最终答案间接引导搜索行为。本文深入分析了这种训练方式下搜索行为的系统性缺陷,包括重复查询、无效搜索和未调用工具等问题,严重影响搜索效率和最终问答质量。为此,提出DeSA(Decoupling Search-and-Answering)框架,通过两阶段训练策略,明确分离搜索行为优化和答案生成任务。在第一阶段,利用召回率奖励强化搜索技能,提升检索的相关性和效率;第二阶段,基于结果奖励细化答案生成能力。实验证明,DeSA在七个问答基准上均优于传统单阶段训练方法,显著降低搜索缺陷率,提升搜索召回和问答准确率。该方法不仅验证了搜索行为中间优化的重要性,也为未来构建更高效、可靠的搜索增强型LLMs提供了理论基础。未来,结合多模态信息和自监督机制,将进一步推动智能问答系统的应用落地,解决复杂任务中的搜索与推理难题。

深度分析

研究背景

近年来,随着GPT系列等大模型的崛起,知识截止和虚假信息成为限制其应用的瓶颈。为解决这一问题,研究者引入检索增强生成(RAG)等技术,将外部知识引入模型,提升事实准确性。随后,交互式搜索代理逐渐兴起,结合Chain-of-Thought(CoT)等推理技术,实现多轮信息检索与推理。强化学习(RL)在训练这些代理中扮演关键角色,推动其自主搜索和推理能力的提升。尽管如此,现有方法多依赖单一的结果奖励,忽视了搜索行为的中间优化,导致搜索效率低下和行为缺陷频发。本文在此背景下,系统分析了搜索代理的行为缺陷,提出了分离训练策略,旨在突破这一瓶颈。

核心问题

当前基于结果奖励的训练方式假设优化最终答案会自然引导搜索行为,然而实际中表现出诸如重复查询、无效搜索和未调用工具等缺陷。这些行为严重影响搜索召回率和答案准确性,限制了模型的性能提升。尤其在复杂、多跳、多模态任务中,这些问题更为突出。单一奖励机制难以提供有效的中间反馈,导致搜索策略难以优化,最终影响整体系统的鲁棒性和效率。因此,亟需一种方法,能够明确指导搜索行为的学习,同时保证答案的质量。

核心创新

本文提出DeSA框架,创新点在于:1)将搜索行为的优化与答案生成解耦,明确两个阶段目标;2)第一阶段通过最大化检索召回率奖励,强化搜索技能,减少重复和无效查询;3)第二阶段利用精确匹配奖励,提升答案的准确性。该策略打破了以结果为唯一导向的限制,提供了中间行为的有效指导。采用GRPO算法确保训练稳定性,结合行为分析,系统验证了其在多个问答数据集上的优越表现。整体创新在于:通过分阶段、目标明确的训练策略,有效提升搜索效率和问答性能,为未来复杂任务中的搜索策略优化提供新思路。

方法详解

  • �� 以预训练大模型(Qwen2.5-3B/7B)为基础,结合GRPO强化学习算法,设计两阶段训练流程。
  • �� 第一阶段:以最大化检索召回(Rrecall)为目标,训练模型生成更相关的搜索查询,减少重复和无效搜索行为。
  • �� 具体措施包括:定义召回奖励(Rrecall),通过检索到的内容是否包含正确答案进行评估。
  • �� 第二阶段:在模型已掌握搜索技能基础上,利用精确匹配(EM)奖励,优化答案生成能力。
  • �� 训练过程中,模型在第一阶段专注于信息检索质量,第二阶段专注于答案准确性,逐步提升整体性能。
  • �� 通过行为分析,验证训练效果,调整奖励设计,确保搜索行为的有效性和答案的可靠性。

实验设计

采用七个问答基准(如NaturalQuestions、HotpotQA等)评估模型性能。比较单阶段(仅用EM奖励)和两阶段(DeSA)训练效果,指标包括搜索召回率、缺陷率和最终EM准确率。使用E5检索器,检索前3条相关内容。超参数包括学习率、训练轮次等。还进行了消融实验,验证不同奖励设计的影响。模型在不同数据集上的表现均优于基线,验证了分离训练策略的有效性。

结果分析

DeSA显著降低搜索缺陷率(从23.36%降至6.96%),提升搜索召回率(至64.5%),在七个问答数据集上平均提升8%的EM准确率。实验证明,行为缺陷如重复查询和无效搜索明显减少,搜索效率提升。最终问答准确率超越单阶段训练方法,验证了中间搜索优化的关键作用。结果表明,明确分离搜索和答案生成的训练策略能有效改善模型的搜索行为和问答性能。

应用场景

该方法适用于智能问答、知识检索、自动化客服等场景,尤其在需要高效信息检索和精确回答的应用中表现突出。通过优化搜索行为,提升系统的响应速度和准确性,降低资源浪费。未来可结合多模态信息和自监督学习,扩展到多任务、多模态环境,推动行业智能化升级。

局限与展望

当前方法依赖外部检索系统,计算成本较高,训练过程复杂。对极端复杂或多模态任务的适应性有限,模型泛化能力仍需提升。未来需优化奖励设计,减少对外部资源的依赖,增强模型的鲁棒性和迁移能力。

通俗解读 非专业人士也能看懂

想象你在厨房做菜,准备一道复杂的菜肴。你需要先找到各种食材(搜索),确保每样都准备齐全(检索效果),然后再按照食谱(答案生成)把菜做出来。如果只关注最后的成品(最终答案),可能会忽略中间的准备工作,导致菜不够好吃或不完整。本文就像教厨师如何先专注于食材的挑选(搜索技能),再专注于烹饪(答案生成),两步分开训练,最后做出更美味的菜。这种方法让厨师既能快速找到好食材,又能做出完美的菜肴。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏。你首先要找到正确的拼图片(搜索),这样才能拼出完整的图案(答案)。如果你只关心拼好后是不是像原图那样漂亮(最终答案),但没有学会怎么找拼图片,你可能会一直拼错、浪费时间。这个研究就像教你先学会怎么快速找到正确的拼图片(第一步:搜索技能),然后再学习怎么拼出漂亮的图(第二步:答案生成)。把这两件事分开训练,你会变成拼图高手,既快又准,拼出更漂亮的图。这就像让你先变成一个擅长找拼图片的高手,再变成拼图大师。

术语表

强化学习 (Reinforcement Learning)

一种让模型通过试错学习决策策略的方法,模型通过奖励或惩罚不断优化行为。

用于训练搜索代理,使其学会有效检索信息。

召回率 (Recall)

衡量检索系统找到所有相关信息的能力,召回率越高,说明检索越全面。

在第一阶段训练中,作为优化搜索行为的奖励指标。

精确匹配 (Exact Match, EM)

评估模型输出与标准答案是否完全一致的指标,常用于问答任务。

在第二阶段用作答案生成的奖励信号。

GRPO (Group Relative Policy Optimization)

一种无需显式值函数的强化学习算法,通过比较多个响应的相对优势进行优化。

用于训练搜索代理,确保训练稳定性。

DeSA (Decoupling Search-and-Answering)

一种将搜索行为优化与答案生成解耦的训练框架,分两阶段进行。

本文提出的核心创新方法。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升多模态、多任务场景下的搜索行为优化效果?
  • 2 在极端复杂或动态环境中,模型的搜索策略如何适应变化?
  • 3 是否可以结合自监督学习进一步减少对外部检索系统的依赖?

应用场景

近期应用

智能问答系统

提升企业客服、知识库问答的准确率和效率,通过优化搜索行为,减少误导和重复查询。

知识检索引擎

增强搜索引擎的相关性和效率,特别是在多轮交互和复杂查询中表现更优。

远期愿景

自主学习型智能体

未来模型能自主优化搜索策略,适应不同任务和环境,实现更高水平的智能推理和决策。

原文摘要

Enabling large language models (LLMs) to utilize search tools offers a promising path to overcoming fundamental limitations such as knowledge cutoffs and hallucinations. Recent work has explored reinforcement learning (RL) for training search-augmented agents that interleave reasoning and retrieval before answering. These approaches usually rely on outcome-based rewards (e.g., exact match), implicitly assuming that optimizing for final answers will also yield effective intermediate search behaviors. Our analysis challenges this assumption: we uncover multiple systematic deficiencies in search that arise under outcome-only training and ultimately degrade final answer quality, including failure to invoke tools, invalid queries, and redundant searches. To address these shortcomings, we introduce DeSA (Decoupling Search-and-Answering), a simple two-stage training framework that explicitly separates search optimization from answer generation. In Stage 1, agents are trained to improve search effectiveness with retrieval recall-based rewards. In Stage 2, outcome rewards are employed to optimize final answer generation. Across seven QA benchmarks, DeSA-trained agents consistently improve search behaviors, delivering substantially higher search recall and answer accuracy than outcome-only baselines. Notably, DeSA outperforms single-stage training approaches that simultaneously optimize recall and outcome rewards, underscoring the necessity of explicitly decoupling the two objectives.

cs.AI