CAFE: Self-Improving Search Agents Need Co-Evolving Feedback

TL;DR

CAFE框架通过共同进化反馈提升搜索代理性能,在七个基准上表现优异。

cs.AI 🔴 高级 2026-08-26 6 次浏览
Boyang Liu Senjie Jin Peixin Wang Zhangyue Yin Yibo Wang Yuhao Zhou Zhihao Zhang Xinbing Liang Shizheng Zhu Yuhui Wang Jingqi Tong Dingwei Zhu Zhiheng Xi Jiazheng Zhang Clive Bai Clarenceai Blaze Chen Tao Gui Qi Zhang Xuanjing Huang
强化学习 搜索代理 反馈机制 共同进化 性能提升

核心发现

方法论

CAFE框架结合了搜索代理和评论者角色,通过共享参数模型交替优化。在线强化学习中,使用比较反馈估计和反馈感知优势重塑来优化请求返回。离线则通过基于回滚的偏好优化学习反馈。

关键结果

  • CAFE在七个基准上平均表现优于其他RL搜索代理,EM提升2.1,F1提升1.3。
  • 在六个域外基准上保持性能提升,并减少答案级幻觉。
  • 单侧消融实验表明,仅改进代理或评论者会导致性能停滞,而交替更新则持续提升性能。

研究意义

CAFE框架通过共同进化反馈机制,解决了长时间搜索中的早期方向性错误问题,显著提升了搜索代理的自我改进能力。这一研究为搜索代理的设计提供了新的视角,强调了反馈与策略的共同进化对性能提升的重要性。

技术贡献

CAFE框架在方法上与现有SOTA方法有根本区别,引入了反馈感知的优势重塑和基于回滚的偏好优化,提供了新的理论保证和工程可能性。

新颖性

CAFE首次提出了反馈与策略共同进化的概念,区别于以往的固定反馈机制,强调了反馈的动态适应性。

局限性

  • CAFE在处理极端复杂的搜索任务时可能会遇到性能瓶颈,因为反馈生成和策略更新的复杂性增加。
  • 需要大量计算资源进行训练,可能不适用于资源有限的环境。

未来方向

未来的研究可以探索CAFE在不同领域的适应性,特别是在资源受限的环境中如何优化反馈生成和策略更新。

AI 总览摘要

CAFE框架通过共同进化反馈提升搜索代理性能,解决了长时间搜索中的早期方向性错误问题。在七个基准上,CAFE表现优于其他RL搜索代理,EM提升2.1,F1提升1.3,并在六个域外基准上保持性能提升。单侧消融实验表明,仅改进代理或评论者会导致性能停滞,而交替更新则持续提升性能。CAFE框架在方法上与现有SOTA方法有根本区别,引入了反馈感知的优势重塑和基于回滚的偏好优化,提供了新的理论保证和工程可能性。未来的研究可以探索CAFE在不同领域的适应性,特别是在资源受限的环境中如何优化反馈生成和策略更新。

深度分析

研究背景

近年来,搜索代理在知识密集型问题求解中扮演着重要角色。然而,现有方法多依赖于固定的反馈机制,难以适应动态变化的搜索环境。CAFE框架通过共同进化反馈机制,解决了这一问题。

核心问题

长时间搜索中的早期方向性错误常导致后续步骤的错误累积,现有方法难以提供即时纠正信号,影响整体性能。

核心创新

CAFE首次提出了反馈与策略共同进化的概念,强调了反馈的动态适应性。通过共享参数模型交替优化搜索代理和评论者角色,提升了搜索代理的自我改进能力。

方法详解

  • �� CAFE框架结合了搜索代理和评论者角色,通过共享参数模型交替优化。 • 在线强化学习中,使用比较反馈估计和反馈感知优势重塑来优化请求返回。 • 离线则通过基于回滚的偏好优化学习反馈。

实验设计

实验在七个基准上进行,使用Qwen2.5-7/3B-Instruct模型,比较了CAFE与其他RL搜索代理的性能。结果显示,CAFE在所有基准上均表现优异。

结果分析

CAFE在七个基准上平均表现优于其他RL搜索代理,EM提升2.1,F1提升1.3,并在六个域外基准上保持性能提升。

应用场景

CAFE可用于需要高精度和动态适应性的搜索任务,如复杂问题求解和知识检索。

局限与展望

CAFE在处理极端复杂的搜索任务时可能会遇到性能瓶颈,因为反馈生成和策略更新的复杂性增加。

通俗解读 非专业人士也能看懂

想象你在一个迷宫中寻找出口。CAFE就像一个智能助手,它不仅会告诉你哪些路是错的,还会根据你的进展实时调整建议,帮助你更快找到出口。通过不断学习和调整,CAFE能在复杂的迷宫中表现得越来越好。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的迷宫游戏,CAFE就像一个超聪明的助手,它会在你走错路时给你提示,还能根据你的进展不断调整策略,帮助你更快找到出口。是不是很酷?

术语表

CAFE (共同进化反馈)

一种通过反馈与策略共同进化来提升搜索代理性能的框架。

CAFE用于提升搜索代理在长时间搜索中的表现。

EM (精确匹配)

一种评估模型输出与标准答案匹配程度的指标。

用于评估CAFE在基准测试中的表现。

F1 (F1分数)

一种结合精确率和召回率的评价指标。

用于评估CAFE在基准测试中的表现。

RL (强化学习)

一种通过试错学习策略以最大化奖励的机器学习方法。

CAFE利用RL进行在线优化。

SFT (监督微调)

一种通过监督学习进行模型微调的方法。

用于初始化CAFE框架。

开放问题 这项研究留下的未解疑问

  • 1 如何在资源受限的环境中优化CAFE的反馈生成和策略更新?
  • 2 CAFE在极端复杂任务中的性能瓶颈如何突破?

应用场景

近期应用

复杂问题求解

CAFE可用于需要高精度和动态适应性的复杂问题求解任务。

远期愿景

知识检索

CAFE在知识检索领域有潜力实现更高效的搜索和信息获取。

原文摘要

Reliable search requires more than acquiring external evidence. An agent must also recognize and recover from errors as its trajectory unfolds. In-trajectory feedback provides a mechanism for such recovery by diagnosing where the search has drifted and redirecting subsequent reasoning steps. This is particularly important in long-horizon search, where an early directional error may receive no immediate corrective signal and can compound across later steps. Making such feedback learnable, however, creates a coupled problem: the agent must learn when to request and use feedback, while the critic must learn corrections from outcome-confounded rollouts as the agent's failure patterns evolve. We introduce CAFE (Coupled Agent--Feedback Evolution), a framework in which a shared-parameter model alternates between search-agent and critic roles. CAFE initializes feedback-conditioned recovery from trajectories built around the base agent's own failures, then couples online and offline optimization. During online RL, a comparative feedback estimate uses a prompt-level call--skip success gap to shape request returns, while feedback-aware advantage shaping reweights token advantages before and after feedback. Offline, rollout-derived preference optimization learns feedback from matched successful and unsuccessful trajectories. On seven agentic search benchmarks, CAFE outperforms the evaluated RL-based search agents on average, retains its gains across all six out-of-domain benchmarks, and reduces answer-level hallucinations. One-sided ablations show that improving only the agent or only the critic eventually plateaus, whereas alternating the two updates continues to improve performance. These findings suggest that a self-improving search agent needs feedback that co-evolves with the policy it guides.

cs.AI