The Missing Complement: State-Conditioned Minimal Sufficient Evidence for Coding Agents

TL;DR

MSS-Complement方法在编码代理中恢复状态条件下的最小充分证据,五项覆盖率达73.0%。

cs.IR 🔴 高级 2026-09-17 9 次浏览
Zhexi Feng Ruiyi Zhang Yongbo Yang Pengtao Xie
编码代理 证据恢复 信息检索 算法 实验

核心发现

方法论

本文提出了一种新的方法MSS-Complement,用于恢复编码代理在决策时所需的最小充分证据。该方法通过语义调用来构建联合充分集合,搜索缺失部分,并在6,144个标记内返回4-8个完整源单元。

关键结果

  • MSS-Complement在五项覆盖率上达到73.0%,在八项上达到80.6%,显著优于Qwen3嵌入和重新排序的61.4%和72.4%。
  • 在AMA-Bench上,MSS-Complement在76.2%更小的提示下回答问题,准确率高出2.08个百分点。
  • 在Action52中,移除一个必要组导致修复定位精度下降12.3和11.1个百分点。

研究意义

该研究通过提出MSS-Complement方法,显著提高了编码代理在决策时的证据恢复能力。这一方法不仅提高了证据覆盖率,还减少了不必要的信息冗余,推动了信息检索领域的进步。

技术贡献

MSS-Complement方法在证据获取上采用集合构建而非排序的策略,与现有方法相比,提供了更高效的证据恢复机制。此方法通过语义调用和证据联合检查,确保了决策所需的充分性。

新颖性

MSS-Complement是首个将证据获取视为集合构建而非排序的方法,显著提升了编码代理的决策支持能力,与传统方法相比,具有更高的证据覆盖率。

局限性

  • 方法在处理复杂多样的证据需求时可能存在局限,尤其是在证据组数量较多的情况下。
  • 需要在不同的任务和数据集上进一步验证其通用性。

未来方向

未来的研究可以探索MSS-Complement在其他领域的应用,如医学诊断和法律分析,并优化其在不同任务中的性能。

AI 总览摘要

编码代理在解决问题时常常面临证据不足的挑战,传统的排序方法无法有效支持决策。MSS-Complement方法通过状态条件下的最小充分证据恢复,提供了一种新的解决方案。该方法通过语义调用构建联合充分集合,搜索缺失部分,并在6,144个标记内返回4-8个完整源单元,显著提高了证据覆盖率。

实验结果表明,MSS-Complement在五项覆盖率上达到73.0%,在八项上达到80.6%,显著优于Qwen3嵌入和重新排序的61.4%和72.4%。在AMA-Bench上,该方法在76.2%更小的提示下回答问题,准确率高出2.08个百分点。此外,在Action52中,移除一个必要组导致修复定位精度下降12.3和11.1个百分点。

这一研究不仅在编码代理的证据恢复上取得了突破,还为信息检索领域提供了新的思路。未来的研究可以探索其在其他领域的应用,并优化其在不同任务中的性能。尽管如此,该方法在处理复杂多样的证据需求时仍存在一定局限,需进一步验证其通用性。

深度分析

研究背景

编码代理在软件开发中扮演着重要角色,但在处理复杂问题时,常常面临证据不足的挑战。传统的信息检索方法通常依赖于排序机制,这在面对多样化的证据需求时显得力不从心。近年来,研究者们开始探索更为高效的证据获取方法,以提高编码代理的决策支持能力。

核心问题

编码代理在决策过程中需要充分的证据支持,但传统的排序方法往往无法满足这种需求。尤其是在面对复杂的证据需求时,单一的排序机制无法有效覆盖所有必要的信息,导致决策支持不足。

核心创新

MSS-Complement方法通过集合构建而非排序的策略,显著提升了证据恢复的效率。该方法通过语义调用来构建联合充分集合,确保决策所需的证据充分性,并通过搜索缺失部分来优化证据覆盖率。

方法详解

  • �� 利用语义调用构建联合充分集合
  • �� 搜索缺失的证据部分
  • �� 在6,144个标记内返回4-8个完整源单元
  • �� 确保决策所需的证据充分性

实验设计

实验在500个状态和45个代码库上进行,使用SERBench进行评估。对比了MSS-Complement与Qwen3嵌入和重新排序的方法,结果显示MSS-Complement在证据覆盖率上具有显著优势。

结果分析

MSS-Complement在五项覆盖率上达到73.0%,在八项上达到80.6%。在AMA-Bench上,该方法在76.2%更小的提示下回答问题,准确率高出2.08个百分点。

应用场景

MSS-Complement可应用于软件开发中的编码代理,帮助其在复杂问题中获取充分的证据支持,提升决策效率。

局限与展望

尽管MSS-Complement在证据恢复上表现出色,但在处理复杂多样的证据需求时仍存在一定局限,需进一步验证其通用性。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,你需要所有的食材来做一道菜。传统的方法就像是把所有的食材按重要性排序,但这并不能保证你有足够的食材来完成这道菜。MSS-Complement方法就像是一个聪明的助手,它会帮你找到所有必要的食材,并确保你有足够的量来完成这道菜。这样一来,你就能更高效地完成烹饪任务,而不必担心缺少某种关键食材。

简单解释 像给14岁少年讲一样

想象一下你在玩一个游戏,需要收集特定的物品来过关。传统的方法就像是按重要性给物品排序,但这并不能保证你收集到所有必要的物品。MSS-Complement就像是一个聪明的助手,它会帮你找到所有必需的物品,并确保你有足够的数量来过关。这样你就能更快地完成游戏,而不必担心遗漏某个关键物品。

术语表

MSS-Complement

一种用于恢复编码代理决策所需最小充分证据的方法。

在本文中用于提高证据覆盖率。

SERBench

用于评估编码代理证据恢复能力的基准。

在实验中用于测试MSS-Complement的性能。

Qwen3嵌入

一种用于信息检索的嵌入方法。

作为对比方法之一。

语义调用

用于构建联合充分集合的步骤。

MSS-Complement方法的核心步骤之一。

证据覆盖率

指决策所需证据的完整性。

用于评估MSS-Complement的有效性。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模的数据集上验证MSS-Complement的有效性?目前的实验规模有限,需进一步扩展。
  • 2 能否将MSS-Complement应用于其他领域,如医学或法律分析?需要探索其跨领域的适用性。

应用场景

近期应用

软件开发

帮助编码代理在复杂问题中获取充分的证据支持,提升决策效率。

远期愿景

跨领域应用

探索MSS-Complement在医学、法律等领域的应用潜力,推动跨领域的技术进步。

原文摘要

A coding agent halfway through an issue has already read much of what a retriever ranks highest. Relevance is scored per passage, but sufficiency belongs to the set: a ranker can fill its budget with variants of one required fact and leave the decision unsupported. We formulate state-conditioned minimal sufficient evidence recovery: given a captured agent state, recover a compact evidence combination that supplies the support its next decision still lacks. SERBench measures this on 500 held-out states from 45 repositories, recording what the agent has seen and crediting only sets that cover every fact the current decision was annotated to require. MSS-Complement treats acquisition as set construction, not ranking. Three semantic calls propose a jointly sufficient set, search for what it lacks, and return 4-8 intact source units within 6,144 tokens. One configuration, fixed on calibration data, recovers a complete set for 73.0% of those states at five items and 80.6% at eight, against 61.4% and 72.4% for Qwen3 embedding with reranking. A matched control ranking by similarity alone reaches 66.6%, placing the gain in the set-level policy, not the computation. From frozen repository source with no gold-derived pool, the lead is 5.0 points. On AMA-Bench it answers from a 76.2% smaller answer prompt, with accuracy 2.08 points above that benchmark's own memory agent. Removing one required group from an otherwise complete set costs 12.3 and 11.1 points of repair-localization precision under two executors. Retrieval for agents is better posed as recovering what a decision lacks than re-ranking what an issue resembles.

cs.IR cs.AI cs.CL