核心发现
方法论
本文提出了一种新的方法MSS-Complement,用于恢复编码代理在决策时所需的最小充分证据。该方法通过语义调用来构建联合充分集合,搜索缺失部分,并在6,144个标记内返回4-8个完整源单元。
关键结果
- MSS-Complement在五项覆盖率上达到73.0%,在八项上达到80.6%,显著优于Qwen3嵌入和重新排序的61.4%和72.4%。
- 在AMA-Bench上,MSS-Complement在76.2%更小的提示下回答问题,准确率高出2.08个百分点。
- 在Action52中,移除一个必要组导致修复定位精度下降12.3和11.1个百分点。
研究意义
该研究通过提出MSS-Complement方法,显著提高了编码代理在决策时的证据恢复能力。这一方法不仅提高了证据覆盖率,还减少了不必要的信息冗余,推动了信息检索领域的进步。
技术贡献
MSS-Complement方法在证据获取上采用集合构建而非排序的策略,与现有方法相比,提供了更高效的证据恢复机制。此方法通过语义调用和证据联合检查,确保了决策所需的充分性。
新颖性
MSS-Complement是首个将证据获取视为集合构建而非排序的方法,显著提升了编码代理的决策支持能力,与传统方法相比,具有更高的证据覆盖率。
局限性
- 方法在处理复杂多样的证据需求时可能存在局限,尤其是在证据组数量较多的情况下。
- 需要在不同的任务和数据集上进一步验证其通用性。
未来方向
未来的研究可以探索MSS-Complement在其他领域的应用,如医学诊断和法律分析,并优化其在不同任务中的性能。
AI 总览摘要
编码代理在解决问题时常常面临证据不足的挑战,传统的排序方法无法有效支持决策。MSS-Complement方法通过状态条件下的最小充分证据恢复,提供了一种新的解决方案。该方法通过语义调用构建联合充分集合,搜索缺失部分,并在6,144个标记内返回4-8个完整源单元,显著提高了证据覆盖率。
实验结果表明,MSS-Complement在五项覆盖率上达到73.0%,在八项上达到80.6%,显著优于Qwen3嵌入和重新排序的61.4%和72.4%。在AMA-Bench上,该方法在76.2%更小的提示下回答问题,准确率高出2.08个百分点。此外,在Action52中,移除一个必要组导致修复定位精度下降12.3和11.1个百分点。
这一研究不仅在编码代理的证据恢复上取得了突破,还为信息检索领域提供了新的思路。未来的研究可以探索其在其他领域的应用,并优化其在不同任务中的性能。尽管如此,该方法在处理复杂多样的证据需求时仍存在一定局限,需进一步验证其通用性。
深度分析
研究背景
编码代理在软件开发中扮演着重要角色,但在处理复杂问题时,常常面临证据不足的挑战。传统的信息检索方法通常依赖于排序机制,这在面对多样化的证据需求时显得力不从心。近年来,研究者们开始探索更为高效的证据获取方法,以提高编码代理的决策支持能力。
核心问题
编码代理在决策过程中需要充分的证据支持,但传统的排序方法往往无法满足这种需求。尤其是在面对复杂的证据需求时,单一的排序机制无法有效覆盖所有必要的信息,导致决策支持不足。
核心创新
MSS-Complement方法通过集合构建而非排序的策略,显著提升了证据恢复的效率。该方法通过语义调用来构建联合充分集合,确保决策所需的证据充分性,并通过搜索缺失部分来优化证据覆盖率。
方法详解
- �� 利用语义调用构建联合充分集合
- �� 搜索缺失的证据部分
- �� 在6,144个标记内返回4-8个完整源单元
- �� 确保决策所需的证据充分性
实验设计
实验在500个状态和45个代码库上进行,使用SERBench进行评估。对比了MSS-Complement与Qwen3嵌入和重新排序的方法,结果显示MSS-Complement在证据覆盖率上具有显著优势。
结果分析
MSS-Complement在五项覆盖率上达到73.0%,在八项上达到80.6%。在AMA-Bench上,该方法在76.2%更小的提示下回答问题,准确率高出2.08个百分点。
应用场景
MSS-Complement可应用于软件开发中的编码代理,帮助其在复杂问题中获取充分的证据支持,提升决策效率。
局限与展望
尽管MSS-Complement在证据恢复上表现出色,但在处理复杂多样的证据需求时仍存在一定局限,需进一步验证其通用性。
通俗解读 非专业人士也能看懂
想象你在厨房里做饭,你需要所有的食材来做一道菜。传统的方法就像是把所有的食材按重要性排序,但这并不能保证你有足够的食材来完成这道菜。MSS-Complement方法就像是一个聪明的助手,它会帮你找到所有必要的食材,并确保你有足够的量来完成这道菜。这样一来,你就能更高效地完成烹饪任务,而不必担心缺少某种关键食材。
简单解释 像给14岁少年讲一样
想象一下你在玩一个游戏,需要收集特定的物品来过关。传统的方法就像是按重要性给物品排序,但这并不能保证你收集到所有必要的物品。MSS-Complement就像是一个聪明的助手,它会帮你找到所有必需的物品,并确保你有足够的数量来过关。这样你就能更快地完成游戏,而不必担心遗漏某个关键物品。
术语表
MSS-Complement
一种用于恢复编码代理决策所需最小充分证据的方法。
在本文中用于提高证据覆盖率。
SERBench
用于评估编码代理证据恢复能力的基准。
在实验中用于测试MSS-Complement的性能。
Qwen3嵌入
一种用于信息检索的嵌入方法。
作为对比方法之一。
语义调用
用于构建联合充分集合的步骤。
MSS-Complement方法的核心步骤之一。
证据覆盖率
指决策所需证据的完整性。
用于评估MSS-Complement的有效性。
开放问题 这项研究留下的未解疑问
- 1 如何在更大规模的数据集上验证MSS-Complement的有效性?目前的实验规模有限,需进一步扩展。
- 2 能否将MSS-Complement应用于其他领域,如医学或法律分析?需要探索其跨领域的适用性。
应用场景
近期应用
软件开发
帮助编码代理在复杂问题中获取充分的证据支持,提升决策效率。
远期愿景
跨领域应用
探索MSS-Complement在医学、法律等领域的应用潜力,推动跨领域的技术进步。
原文摘要
A coding agent halfway through an issue has already read much of what a retriever ranks highest. Relevance is scored per passage, but sufficiency belongs to the set: a ranker can fill its budget with variants of one required fact and leave the decision unsupported. We formulate state-conditioned minimal sufficient evidence recovery: given a captured agent state, recover a compact evidence combination that supplies the support its next decision still lacks. SERBench measures this on 500 held-out states from 45 repositories, recording what the agent has seen and crediting only sets that cover every fact the current decision was annotated to require. MSS-Complement treats acquisition as set construction, not ranking. Three semantic calls propose a jointly sufficient set, search for what it lacks, and return 4-8 intact source units within 6,144 tokens. One configuration, fixed on calibration data, recovers a complete set for 73.0% of those states at five items and 80.6% at eight, against 61.4% and 72.4% for Qwen3 embedding with reranking. A matched control ranking by similarity alone reaches 66.6%, placing the gain in the set-level policy, not the computation. From frozen repository source with no gold-derived pool, the lead is 5.0 points. On AMA-Bench it answers from a 76.2% smaller answer prompt, with accuracy 2.08 points above that benchmark's own memory agent. Removing one required group from an otherwise complete set costs 12.3 and 11.1 points of repair-localization precision under two executors. Retrieval for agents is better posed as recovering what a decision lacks than re-ranking what an issue resembles.