When Your Agent Opens the Chat App: Agent-Controlled Search over Raw Chat Logs Rivals Structured Memory

TL;DR

ReFind是一种无需结构化索引的对话搜索方法,达成58.2%平均准确率。

cs.CL 🔴 高级 2026-08-13 33 次浏览
Ruizhe Li Licheng Zhang Benfeng Xu Mingxuan Du Zheren Fu Weidong Chen
对话检索 信息检索 无结构索引 多轮对话 GPT-4

核心发现

方法论

ReFind采用基于词汇的索引(BM25)结合四个聊天原生控制机制:会话感知排序融合、局部上下文扩展、时间范围缩窄和已检索会话跳过。系统通过多轮迭代关键词搜索,收集证据后由推理阶段生成答案。该方法未构建语义结构,保持原始对话不变,依赖搜索控制实现高效检索。实验证明在MemoryAgentBench和LongMemEval上,ReFind显著优于结构化记忆系统,平均准确率达58.2%。

关键结果

  • 在MemoryAgentBench的多任务评测中,ReFind以58.2%的平均准确率领先所有对比系统(HippoRAG 2为53.2%),显示无需预先构建语义索引即可实现高精度检索。
  • 在LongMemEval-S/M测试中,使用gpt-4o,ReFind达到93.2%和89.3%的准确率,优于所有结构化记忆模型。
  • 消融实验显示,聊天原生控制和会话感知排序融合对性能提升至关重要,单纯依赖关键词检索效果有限。

研究意义

该研究挑战了传统依赖结构化记忆的假设,表明在对话检索中,给模型提供可控的搜索界面,结合简单的词汇索引和策略控制,能达到甚至超越复杂结构的效果。这为大规模对话系统的存储与检索提供了新思路,降低了索引构建成本,提升了系统的适应性和可扩展性。

技术贡献

提出ReFind系统,摒弃预先构建语义索引,采用词汇级索引结合多维检索控制机制,实现在未修改原始对话的情况下高效检索。通过会话感知排序融合、时间过滤和会话去重等技术,有效提升检索精度。系统设计强调模型的主动搜索能力,结合多轮迭代与策略调控,突破了传统结构化记忆的局限,为对话信息检索提供全新范式。

新颖性

首次提出无需语义结构的纯词汇索引结合多策略控制的对话检索框架,验证其在多任务、多轮对话中的优越性。区别于以往依赖图结构或知识图谱的记忆系统,ReFind强调模型主动搜索和动态控制,极大简化了索引构建流程,彰显了策略驱动的检索新思路。

局限性

  • 该方法在极端长对话或高度噪声环境下可能表现不足,因词汇匹配的局限性。
  • 对复杂推理或隐含信息的捕捉能力有限,需结合更深层次理解机制。
  • 系统依赖关键词搜索策略,可能在某些语义模糊场景中效果受限。

未来方向

未来将探索结合深层语义理解的多模态检索策略,提升复杂推理能力;同时优化搜索策略的自适应调节,增强系统在多样化场景中的鲁棒性。还计划结合知识图谱和结构化索引,兼容多层次信息管理,推动对话系统的智能化发展。

AI 总览摘要

在对话系统的研究中,存储与检索一直是核心难题。传统方法依赖预先构建语义索引或结构化存储,如知识图谱或树状结构,以提升检索效率和准确性。然而,这些结构化记忆在面对长对话和多任务场景时,存在索引成本高、更新困难、灵活性不足等问题。本文提出ReFind,一种无需构建语义结构的对话检索方法。它基于词汇索引(BM25)结合多种聊天原生控制策略,通过多轮关键词搜索,动态调节搜索范围和排序,模拟人类在聊天中逐步追踪信息的过程。系统设计包括会话感知排序融合、局部上下文扩展、时间范围过滤和已检索会话跳过,极大提升检索的精度和效率。实验结果显示,ReFind在MemoryAgentBench和LongMemEval两个多任务、多轮对话评测中,均优于传统结构化记忆系统,平均准确率达58.2%和93.2%。这一发现表明,复杂的语义索引并非唯一途径,策略驱动的搜索控制同样可以实现高效、精确的对话信息检索。该研究为未来大规模对话系统的存储与检索提供了新思路,降低了系统复杂度,增强了适应性和扩展性。未来工作将结合深层语义理解和多模态信息,进一步提升系统的推理能力和鲁棒性,推动智能对话技术的创新发展。

深度分析

研究背景

随着大规模语言模型(LLMs)在对话系统中的应用不断深入,存储与检索成为瓶颈。传统方法多依赖结构化记忆,如知识图谱、树状结构或向量存储,以提升检索效率。然而,这些方法在面对长对话和多任务场景时,索引成本高、维护复杂,且预先构建的语义结构可能遗漏细节。近年来,研究逐渐转向结合检索增强生成(RAG)等技术,试图在保持原始对话的基础上,提升检索精度。代表性工作包括HippoRAG、GraphRAG和MemoRAG等,它们通过不同的结构化方式实现多跳推理和知识整合。尽管如此,构建和维护这些结构仍面临高成本和复杂性,限制了其在实际应用中的普及。与此同时,用户行为研究表明,人们在信息检索中更倾向于逐步探索、利用上下文和时间线索,而非一次性关键词搜索。这启发了无需预先结构化索引、依赖策略控制的检索方法的探索。

核心问题

核心问题在于,传统依赖结构化记忆的系统在面对长对话和复杂查询时,存在索引成本高、更新困难、灵活性不足等瓶颈。尤其是在多轮、多任务场景中,预先构建的语义索引可能遗漏细节,限制了检索的准确性和适应性。如何在保持原始对话完整性的基础上,实现高效、精确的检索,成为亟待解决的问题。此外,现有系统多依赖复杂的索引结构,增加了系统复杂度和维护成本,限制了其在实际应用中的扩展性。本文试图突破这一瓶颈,提出无需预先构建语义索引的检索框架,依赖策略控制实现高效搜索。

核心创新

创新点在于:1)提出ReFind系统,摒弃预先构建语义索引,采用词汇级索引(BM25)实现即时搜索;2)引入多维策略控制,包括会话感知排序融合、局部上下文扩展、时间过滤和已检索会话跳过,模仿人类逐步追踪信息的行为;3)利用多轮关键词搜索结合策略调节,实现高精度检索。此方法显著降低索引成本,增强系统灵活性,适应长对话和多任务场景,突破了传统结构化记忆的限制。

方法详解

  • �� 构建词汇索引:对每个对话轮次进行分词索引,无需预训练模型或语义抽象。• 多轮迭代搜索:模型自主生成关键词,进行多轮关键词检索,逐步收集证据。• 策略控制:引入会话感知排序融合(RRF)、局部上下文扩展(±2轮)、时间范围过滤和已检索会话跳过,动态调节搜索范围。• 证据整合:将多轮检索得到的片段按会话和时间排序,形成证据集。• 答案生成:在单独推理阶段,模型从证据中生成最终答案,避免检索与推理竞争上下文空间。

实验设计

采用MemoryAgentBench和LongMemEval两个多任务评测套件,测试系统在单/多跳问答、事件排序、事实整合等任务中的表现。对比结构化记忆系统(HippoRAG 2、GraphRAG)和单次检索(BM25),评估指标包括准确率、召回率等。超参数设定为多轮迭代最多4次,每轮检索Top-5,策略控制包括会话感知排序、时间过滤等。通过消融实验验证各控制机制的贡献,确保系统在不同场景下的鲁棒性。

结果分析

ReFind在MemoryAgentBench上实现平均58.2%的准确率,优于HippoRAG 2(53.2%)和BM25(48.8%),在多任务场景中表现优异。LongMemEval测试中,使用gpt-4o,ReFind达93.2%和89.3%的准确率,超越所有结构化模型。消融实验显示会话感知排序和策略控制对性能提升至关重要,单纯关键词检索效果有限。这些结果验证了策略控制在无需结构化索引情况下的有效性,彰显了其广泛应用潜力。

应用场景

该方法适用于需要高精度信息检索的对话系统、客户服务、法律和医疗问答等场景。系统无需复杂索引构建,适合大规模长对话存储,提升检索效率和用户体验。未来可结合深层语义理解和多模态信息,扩展到多领域、多任务的智能对话平台,推动行业智能化升级。

局限与展望

当前方法主要依赖关键词匹配,面对语义模糊或隐含信息时效果有限。长对话中噪声和冗余可能影响检索效率。系统在极端长文本和高复杂度推理场景下表现尚需优化,未来需结合深层理解和多模态信息增强鲁棒性。

通俗解读 非专业人士也能看懂

想象你在图书馆找一本书。传统的方法就像提前把所有书都整理好,建立索引,知道每本书的内容和位置,然后快速找到它。而ReFind则像你在图书馆里用手指点着书架,逐步翻找,边找边用关键词引导自己,直到找到想要的内容。它不用提前把所有书的内容都总结好,也不用建立复杂的目录,而是根据你每次的搜索结果,动态调整下一步的搜索方向。这就像你用手指在书架上摸索,逐步缩小范围,最终找到目标。这种方式更灵活,也更节省整理的时间和成本,但需要你有耐心和策略。ReFind的核心思想是:不要事先把所有信息都整理成结构,而是让模型像人一样,边找边调整搜索策略,最终找到答案。

简单解释 像给14岁少年讲一样

想象你在学校图书馆找一本书。以前的方法就像提前把所有书都整理好,知道每本书在哪,想找什么就直接去对应的架子。而ReFind就像你用手指在书架上摸索,边翻边用关键词引导自己。你可能会先用一个关键词试试,找到一些书,然后再用更具体的词,逐步缩小范围,直到找到那本书。这种找书的方法不需要提前整理所有内容,只靠你自己边找边调整策略。ReFind就是用这种“边找边调整”的办法,让模型像人一样在对话记录中逐步追踪信息,而不是依赖复杂的索引或结构。这种方式更灵活,也能节省很多准备工作,特别适合长对话和复杂问题。

原文摘要

Agent-memory systems increasingly buy retrieval quality with structure, transforming raw conversation histories into summaries, embeddings, trees, or knowledge graphs before any question is asked. We ask how much of that benefit comes from the structure itself, rather than from competent retrieval over the raw history. We present ReFind, an agent-controlled search interface that builds no semantic structure at all: it leaves the conversation archive unmodified, indexes it lexically at turn granularity, and combines a generic iterative keyword-search loop with four chat-native controls grounded in empirical refinding work: session-aware rank fusion, local context expansion, temporal narrowing, and skipping already-inspected sessions. A separate reasoning stage answers from the collected evidence. Across a broad suite of conversational-memory tasks (single- and multi-hop QA, event ordering, and fact consolidation), roughly 2,800 questions on precise-retrieval and fact-tracking capabilities evaluated under the incremental multi-turn setting of MemoryAgentBench, ReFind attains the highest mean accuracy (58.2) of any system compared, above the strongest graph- and tree-based memory systems (HippoRAG 2, 53.2), all under a GPT-4o-mini backbone matched to every reused baseline. Controlled comparisons to single-shot BM25, a matched generic-agentic BM25 control, component removals, and agentic dense/hybrid variants separately support the roles of agent control, chat-native controls, and lexical retrieval. On LongMemEval-S/M, the same interface reaches 93.2 +/- 3.3 and 89.3 +/- 6.0 with GPT-5-mini. The results indicate that for precise, evidence-grounded questions over chat archives, much of the benefit credited to elaborate memory structures is recoverable by giving an agent controllable search over the unmodified record, with no LLM-based index construction at all.

cs.CL