Knowledge-Graph Paths as Intermediate Supervision for Self-Evolving Search Agents

TL;DR

提出利用知识图谱路径作为中间监督,改进自演化搜索代理的问答生成与解答能力,平均提升多跳问答准确率7.3%。

cs.AI 🔴 高级 2026-05-07 26 次浏览
Huyu Wu Jun Liu Xiaochi Wei Yan Gao Yi Wu Yao Hu
知识图谱 自演化搜索 多跳问答 中间监督 奖励设计

核心发现

方法论

通过知识图谱路径提供关系上下文,改进问题生成;引入路径覆盖奖励(WCR),为错误解答轨迹赋予部分奖励,优化搜索效率。

关键结果

  • 在Qwen2.5-7B-Base模型上,平均准确率从44.9%提升至49.4%,多跳问答准确率从34.2%提升至41.5%。
  • 在七个问答基准测试中,所有配置均优于标准SSP,尤其在多跳任务中表现显著。
  • 路径覆盖奖励显著提高了错误轨迹的区分度,优化了训练信号。

研究意义

该方法减少了对人工标注的依赖,提升了搜索代理的生成与解答能力,特别是在复杂的多跳推理任务中,为知识图谱与语言模型结合开辟了新方向。

技术贡献

首次将知识图谱路径同时用于问题生成与奖励设计,提出路径覆盖奖励(WCR),实现了任务构建与奖励信号的统一,提升了训练效率。

新颖性

该研究首次将知识图谱路径作为双重用途的中间监督,结合LLM指导的子图提取与奖励设计,显著改善了自演化搜索代理的性能。

局限性

  • 路径覆盖奖励仅适用于知识图谱支持的任务,无法扩展至无结构数据。
  • 对路径覆盖的依赖可能导致对知识图谱质量的敏感性。
  • 未解决多跳推理中可能存在的语义模糊问题。

未来方向

未来可探索将路径覆盖奖励扩展至无结构数据任务,并优化知识图谱提取算法以支持更复杂的推理场景。

AI 总览摘要

自演化搜索代理通过生成并解决自身的训练任务,减少了对人工标注的依赖。然而,现有框架如搜索自对弈(SSP)存在两个瓶颈:问题生成缺乏关系上下文,导致早期训练数据质量低;解答奖励仅为二元结果,忽略了部分正确轨迹的信号。

本文提出利用知识图谱路径作为中间监督,通过LLM指导的子图提取为问题生成提供关系上下文,并引入路径覆盖奖励(WCR),为错误轨迹赋予部分奖励。实验表明,该方法在七个问答基准测试中均优于标准SSP,尤其在多跳任务中表现显著,平均准确率提升7.3%。

该研究不仅减少了对人工标注的依赖,还为知识图谱与语言模型结合开辟了新方向。未来工作可探索扩展至无结构数据任务,并优化知识图谱提取算法以支持更复杂的推理场景。

深度分析

研究背景

近年来,自演化搜索代理逐渐成为研究热点,通过生成并解决自身任务减少人工标注需求。代表性框架如搜索自对弈(SSP)利用提问者与解答者的闭环训练实现多步搜索与推理,但仍依赖人工验证问题质量。

核心问题

SSP存在两个瓶颈:问题生成缺乏关系上下文,导致早期数据质量低;解答奖励仅为二元结果,忽略了部分正确轨迹的信号。这限制了训练效率和模型性能。

核心创新

本文提出利用知识图谱路径作为中间监督:1) 提供关系上下文改进问题生成;2) 引入路径覆盖奖励(WCR),为错误轨迹赋予部分奖励,优化训练信号。

方法详解

  • �� 使用LLM指导从知识图谱中提取子图,构建目标路径与干扰分支。
  • �� 提问者利用子图生成问题,确保问题具备多跳上下文。
  • �� 解答者通过路径覆盖奖励(WCR)对错误轨迹赋予部分奖励,提升训练效率。
  • �� 采用GRPO优化解答者,REINFORCE优化提问者。

实验设计

实验使用七个问答基准测试,包括NQ、TriviaQA、HotpotQA等,评估多跳推理能力。对比标准SSP,分析路径覆盖奖励的影响,并进行消融实验验证贡献。

结果分析

在Qwen2.5-7B-Base模型上,平均准确率从44.9%提升至49.4%,多跳问答准确率从34.2%提升至41.5%。路径覆盖奖励显著提高了错误轨迹的区分度。

应用场景

该方法适用于多跳问答任务,尤其在需要复杂推理的场景中,如知识图谱问答、搜索引擎优化。

局限与展望

路径覆盖奖励依赖知识图谱质量,无法扩展至无结构数据任务。未来需优化路径提取算法以支持更复杂的推理场景。

通俗解读 非专业人士也能看懂

想象你在一个迷宫中寻找出口。迷宫中有指示牌告诉你可能的方向,但并不直接指向出口。本文的方法就像在迷宫中添加更多指示牌,让你即使走错路,也能获得一些奖励,帮助你更快找到出口。

简单解释 像给14岁少年讲一样

想象你玩一个解谜游戏,需要找到正确答案。每次你接近正确答案,游戏都会给你一点奖励,即使你没完全答对。这种奖励机制让你更容易学会如何解谜!

术语表

知识图谱 (Knowledge Graph)

一种结构化数据表示,用节点和边表示实体及其关系。

用于生成问题的上下文信息。

路径覆盖奖励 (Waypoint Coverage Reward)

一种奖励机制,根据解答轨迹覆盖的路径节点数量赋予部分奖励。

用于优化解答者的训练信号。

搜索自对弈 (Search Self-Play)

一个闭环训练框架,提问者生成问题,解答者解决问题。

作为本文的基准方法。

LLM指导子图提取 (LLM-Guided Subgraph Extraction)

使用语言模型从知识图谱中提取目标路径与干扰分支。

为问题生成提供关系上下文。

多跳问答 (Multi-Hop QA)

需要多步推理才能回答的问题类型。

评估本文方法的核心任务。

开放问题 这项研究留下的未解疑问

  • 1 如何扩展路径覆盖奖励至无结构数据任务?
  • 2 知识图谱质量对训练效果的具体影响是什么?

应用场景

近期应用

知识图谱问答

提升复杂问答任务的准确率,适用于搜索引擎优化。

教育领域推理训练

用于训练学生的逻辑推理能力,减少人工标注需求。

远期愿景

通用推理代理

开发能处理无结构数据的推理系统,实现更广泛的应用。

原文摘要

Self-evolving search agents reduce reliance on human-written training questions by generating and solving their own search tasks. We build on Search Self-Play (SSP), a representative Proposer and Solver framework in which questions are generated and answered via multi-step search and reasoning. In practice, however, SSP faces two bottlenecks: the Proposer constructs questions from isolated answer entities without relational context, yielding many invalid or unverifiable questions in early self-play training, while the Solver receives only a binary outcome reward that discards useful signal from partially on-track search trajectories. We address both bottlenecks by reusing knowledge-graph paths as construction-derived intermediate supervision for both question construction and reward shaping. First, we ground question construction in LLM-guided knowledge-graph subgraphs, providing relational context for the Proposer. Second, we observe that constructing and solving a multi-hop question can involve overlapping intermediate entities: the factual bridges used to formulate the question may provide approximate waypoints for answering it. Exploiting this overlap, we introduce Waypoint Coverage Reward (WCR), which grants graded partial credit to incorrect Solver trajectories according to their coverage of entities on the construction path, while preserving full reward for correct answers. Across seven QA benchmarks and nine model configurations, our approach improves the average score over standard SSP in all configurations, including notable gains on multi-hop QA tasks. These results suggest that knowledge-graph paths can be reused as lightweight intermediate supervision, providing both relational guidance and process feedback without additional task-specific human annotations or manually labeled process steps.

cs.AI