CAFE: Self-Improving Search Agents Need Co-Evolving Feedback
CAFE框架通过共同进化反馈提升搜索代理性能,在七个基准上表现优异。
核心发现
方法论
CAFE框架结合了搜索代理和评论者角色,通过共享参数模型交替优化。在线强化学习中,使用比较反馈估计和反馈感知优势重塑来优化请求返回。离线则通过基于回滚的偏好优化学习反馈。
关键结果
- CAFE在七个基准上平均表现优于其他RL搜索代理,EM提升2.1,F1提升1.3。
- 在六个域外基准上保持性能提升,并减少答案级幻觉。
- 单侧消融实验表明,仅改进代理或评论者会导致性能停滞,而交替更新则持续提升性能。
研究意义
CAFE框架通过共同进化反馈机制,解决了长时间搜索中的早期方向性错误问题,显著提升了搜索代理的自我改进能力。这一研究为搜索代理的设计提供了新的视角,强调了反馈与策略的共同进化对性能提升的重要性。
技术贡献
CAFE框架在方法上与现有SOTA方法有根本区别,引入了反馈感知的优势重塑和基于回滚的偏好优化,提供了新的理论保证和工程可能性。
新颖性
CAFE首次提出了反馈与策略共同进化的概念,区别于以往的固定反馈机制,强调了反馈的动态适应性。
局限性
- CAFE在处理极端复杂的搜索任务时可能会遇到性能瓶颈,因为反馈生成和策略更新的复杂性增加。
- 需要大量计算资源进行训练,可能不适用于资源有限的环境。
未来方向
未来的研究可以探索CAFE在不同领域的适应性,特别是在资源受限的环境中如何优化反馈生成和策略更新。
AI 总览摘要
CAFE框架通过共同进化反馈提升搜索代理性能,解决了长时间搜索中的早期方向性错误问题。在七个基准上,CAFE表现优于其他RL搜索代理,EM提升2.1,F1提升1.3,并在六个域外基准上保持性能提升。单侧消融实验表明,仅改进代理或评论者会导致性能停滞,而交替更新则持续提升性能。CAFE框架在方法上与现有SOTA方法有根本区别,引入了反馈感知的优势重塑和基于回滚的偏好优化,提供了新的理论保证和工程可能性。未来的研究可以探索CAFE在不同领域的适应性,特别是在资源受限的环境中如何优化反馈生成和策略更新。
深度分析
研究背景
近年来,搜索代理在知识密集型问题求解中扮演着重要角色。然而,现有方法多依赖于固定的反馈机制,难以适应动态变化的搜索环境。CAFE框架通过共同进化反馈机制,解决了这一问题。
核心问题
长时间搜索中的早期方向性错误常导致后续步骤的错误累积,现有方法难以提供即时纠正信号,影响整体性能。
核心创新
CAFE首次提出了反馈与策略共同进化的概念,强调了反馈的动态适应性。通过共享参数模型交替优化搜索代理和评论者角色,提升了搜索代理的自我改进能力。
方法详解
- �� CAFE框架结合了搜索代理和评论者角色,通过共享参数模型交替优化。 • 在线强化学习中,使用比较反馈估计和反馈感知优势重塑来优化请求返回。 • 离线则通过基于回滚的偏好优化学习反馈。
实验设计
实验在七个基准上进行,使用Qwen2.5-7/3B-Instruct模型,比较了CAFE与其他RL搜索代理的性能。结果显示,CAFE在所有基准上均表现优异。
结果分析
CAFE在七个基准上平均表现优于其他RL搜索代理,EM提升2.1,F1提升1.3,并在六个域外基准上保持性能提升。
应用场景
CAFE可用于需要高精度和动态适应性的搜索任务,如复杂问题求解和知识检索。
局限与展望
CAFE在处理极端复杂的搜索任务时可能会遇到性能瓶颈,因为反馈生成和策略更新的复杂性增加。
通俗解读 非专业人士也能看懂
想象你在一个迷宫中寻找出口。CAFE就像一个智能助手,它不仅会告诉你哪些路是错的,还会根据你的进展实时调整建议,帮助你更快找到出口。通过不断学习和调整,CAFE能在复杂的迷宫中表现得越来越好。
简单解释 像给14岁少年讲一样
想象你在玩一个超级复杂的迷宫游戏,CAFE就像一个超聪明的助手,它会在你走错路时给你提示,还能根据你的进展不断调整策略,帮助你更快找到出口。是不是很酷?
术语表
CAFE (共同进化反馈)
一种通过反馈与策略共同进化来提升搜索代理性能的框架。
CAFE用于提升搜索代理在长时间搜索中的表现。
EM (精确匹配)
一种评估模型输出与标准答案匹配程度的指标。
用于评估CAFE在基准测试中的表现。
F1 (F1分数)
一种结合精确率和召回率的评价指标。
用于评估CAFE在基准测试中的表现。
RL (强化学习)
一种通过试错学习策略以最大化奖励的机器学习方法。
CAFE利用RL进行在线优化。
SFT (监督微调)
一种通过监督学习进行模型微调的方法。
用于初始化CAFE框架。
开放问题 这项研究留下的未解疑问
- 1 如何在资源受限的环境中优化CAFE的反馈生成和策略更新?
- 2 CAFE在极端复杂任务中的性能瓶颈如何突破?
应用场景
近期应用
复杂问题求解
CAFE可用于需要高精度和动态适应性的复杂问题求解任务。
远期愿景
知识检索
CAFE在知识检索领域有潜力实现更高效的搜索和信息获取。
原文摘要
Reliable search requires more than acquiring external evidence. An agent must also recognize and recover from errors as its trajectory unfolds. In-trajectory feedback provides a mechanism for such recovery by diagnosing where the search has drifted and redirecting subsequent reasoning steps. This is particularly important in long-horizon search, where an early directional error may receive no immediate corrective signal and can compound across later steps. Making such feedback learnable, however, creates a coupled problem: the agent must learn when to request and use feedback, while the critic must learn corrections from outcome-confounded rollouts as the agent's failure patterns evolve. We introduce CAFE (Coupled Agent--Feedback Evolution), a framework in which a shared-parameter model alternates between search-agent and critic roles. CAFE initializes feedback-conditioned recovery from trajectories built around the base agent's own failures, then couples online and offline optimization. During online RL, a comparative feedback estimate uses a prompt-level call--skip success gap to shape request returns, while feedback-aware advantage shaping reweights token advantages before and after feedback. Offline, rollout-derived preference optimization learns feedback from matched successful and unsuccessful trajectories. On seven agentic search benchmarks, CAFE outperforms the evaluated RL-based search agents on average, retains its gains across all six out-of-domain benchmarks, and reduces answer-level hallucinations. One-sided ablations show that improving only the agent or only the critic eventually plateaus, whereas alternating the two updates continues to improve performance. These findings suggest that a self-improving search agent needs feedback that co-evolves with the policy it guides.