EXCISE: Query-Side Exclusion for Late-Interaction Retrieval

TL;DR

EXCISE通过查询端模块解决后期交互检索中的排除反转问题,提升排除成功率至0.691。

cs.IR 🔴 高级 2026-08-06 107 次浏览
Mohammed Ali Abdelrahman Abdallah Adam Jatowt
信息检索 深度学习 排除查询 后期交互 模型优化

核心发现

方法论

该研究基于对ColBERT等后期交互检索模型的分析,发现MaxSim评分在处理排除查询时存在排除反转的问题。作者提出了EXCISE框架,核心包括两个轻量级的查询端模块:排除检测器和排除适配器。检测器利用对比学习识别查询中的排除主题,适配器则对候选文档短名单进行重新嵌入,利用无参数的规则对匹配排除主题的候选进行降权。整个系统在不修改索引的前提下,通过在查询端进行动态修正,有效解决了排除反转问题。模型在六个不同数据集和三种骨干模型上均表现优异,显著提升排除成功率和布尔否定准确率,验证了其普适性和鲁棒性。

关键结果

  • 在ExcluIR数据集上,EXCISE将排除成功@10从0.058提升至0.691,布尔否定准确率从0.25-0.29跃升至0.90-0.92,表现优于所有对比的微调模型和冻结索引。该系统在18个不同的骨干模型-数据集单元中均为最优,显示出强大的泛化能力。
  • 在1,860个查询的整体评估中,EXCISE超越了每个微调的跨编码器模型,且在保持无害检索(nDCG@10不下降)的同时实现了排除效果,验证了其在实际应用中的实用性。
  • 通过引入X-BENCH基准,涵盖显式、隐式和复合排除场景,系统在不同复杂度和控制条件下均表现出优异的排除能力,特别是在多领域(法律、金融、医疗等)数据集上,展现出广泛适用性。

研究意义

该研究突破了后期交互检索模型在处理排除查询中的核心难题,提供了一种无需重新编码索引的动态修正方案。排除反转一直是深度检索中的难点,影响了法律、医疗、金融等对精确排除要求极高的场景。通过在查询端进行主题识别和候选降权,极大提升了排除的成功率,推动了检索系统的实用化和智能化。该方法不仅解决了模型固有的偏差问题,也为未来构建更具解释性和控制性的检索系统提供了技术基础。

技术贡献

本研究的技术创新在于将排除主题识别与候选文档重嵌入结合,提出了基于查询端的动态修正机制。具体包括:• 设计了轻量级的排除检测器,利用对比学习训练识别排除主题;• 引入排除适配器,对候选短名单进行重新嵌入,增强排除判定能力;• 提出无参数的降权规则,确保在误判时对排名影响有限,保证系统的安全性。该方案在保持索引不变的基础上,实现了排除效果的显著提升,突破了传统微调和索引重建的限制,为后期交互检索提供了新的技术路径。

新颖性

本研究的创新点在于首次提出在查询端动态识别排除主题并进行候选降权的机制,避免了索引重建的高成本和模型微调带来的性能损失。相较于现有的指令调优或跨编码器重排序方法,EXCISE实现了在保持索引冻结的同时,显著提升排除成功率,尤其在复杂多主题、多领域场景中表现优越。这一方法在理论上提供了对MaxSim评分偏差的深入分析,并在实践中验证了其有效性,具有较强的创新性和实用价值。

局限性

  • 系统依赖于查询端的排除主题识别,若检测器误判或漏检,可能导致排除效果下降,尤其在复杂或模糊的查询中表现不佳。
  • 候选文档的重嵌入仅限于短名单,若目标文档未在初始候选集中,系统无法补救,影响召回率,尤其在长尾或新颖内容中表现有限。
  • 在极端长文本或高噪声环境下,Evidence评分的稳定性可能受到影响,导致降权规则的效果减弱,未来需引入更鲁棒的特征表示。

未来方向

未来的研究方向包括:• 提升排除检测器的鲁棒性,结合多模态信息或上下文理解增强识别能力;• 扩展系统支持多排除主题的复杂场景,提升多任务处理能力;• 结合索引层面的优化,探索索引结构的动态调整与排除机制的结合,以进一步提升效率和效果;• 研究在大规模、多领域、多语言环境下的适应性和扩展性,推动实际应用落地。

AI 总览摘要

在信息检索的实际应用中,用户常常需要排除某些特定主题的内容,比如在法律或医疗检索中避免出现不相关或敏感信息。传统的后期交互检索模型如ColBERT,虽然在相关性排序方面表现优异,但在处理排除查询时存在严重的反转问题,即“排除反转”。这种现象使得包含排除主题的文档反而被提升到前列,严重影响检索的准确性和实用性。

为解决这一难题,Mohammed Ali等人提出了名为EXCISE的创新框架。该方法在查询端引入两个关键模块:排除检测器和排除适配器。检测器通过对比学习识别查询中的排除主题,作为动态开关激活或关闭后续的候选重嵌入过程。适配器则对候选短名单中的文档进行重新嵌入,利用无参数的降权规则对匹配排除主题的候选进行降级处理。这一机制在保持索引不变的前提下,有效地解决了“排除反转”问题,显著提升了排除成功率。

实验结果显示,EXCISE在六个不同的公开数据集和三种不同的骨干模型上均取得了优异表现。在ExcluIR数据集上,排除成功@10从0.058提升至0.691,布尔否定准确率从0.25-0.29跃升至0.90-0.92。更重要的是,该系统在不牺牲普通检索性能的前提下,显著改善了排除效果,验证了其广泛适用性和鲁棒性。这一突破为深度检索模型在实际场景中的应用提供了新的解决方案。

此外,作者还推出了X-BENCH基准,涵盖显式、隐式和复合排除场景,支持无害和布尔控制,适用于多领域、多任务的评估需求。未来工作将集中在提升检测器的鲁棒性、支持多排除主题、多模态信息融合,以及索引结构的动态优化,推动检索系统向更智能、更可控的方向发展。整体而言,EXCISE为深度信息检索中的排除问题提供了创新的技术路径,具有重要的理论价值和广泛的应用前景。

深度分析

研究背景

随着深度学习的发展,后期交互检索模型如ColBERT、GTR等在信息检索领域取得了突破性进展。这些模型通过交互式匹配机制,有效提升了相关性排序的准确性,广泛应用于法律、医疗、金融等对检索精度要求极高的场景。然而,尽管在相关性方面表现优异,它们在处理排除查询(如“我想找关于电动汽车的资料,但不要特斯拉”)时,仍面临巨大挑战。传统方法多依赖微调或索引重建,但这些方案成本高昂且难以应对动态变化的查询需求。近年来,研究者开始关注在查询端引入控制机制,以实现更灵活的检索调节。代表性工作包括指令调优(Instruction Tuning)和跨编码器重排序(Cross-Encoder Reranking),但这些方法要么需要大量训练资源,要么在复杂排除场景中效果有限。因此,如何在保持索引不变的基础上,有效识别排除主题并动态调整候选排名,成为当前研究的热点和难点。

核心问题

核心问题在于后期交互模型在处理排除查询时出现的“反转”现象,即包含排除主题的文档反而被提升。原因在于MaxSim评分的加性特性,导致匹配排除主题的词汇在评分中占据过大比重,从而误导模型将不相关文档排名靠前。现有的解决方案如微调模型或重排序器,虽然在某些场景有效,但成本高、灵活性差,且不能在索引层面实现快速动态调节。更严重的是,模型难以从冻结的向量中区分排除主题,导致排除效果难以保证。这些问题限制了深度检索模型在实际应用中的可靠性和可控性,亟需一种低成本、高效、可动态调节的解决方案。

核心创新

本研究的创新点主要包括:• 提出在查询端引入排除检测器,利用对比学习识别排除主题,避免在索引层进行微调;• 设计排除适配器,对候选短名单进行重新嵌入,增强模型对排除主题的敏感性;• 引入无参数的降权规则,动态调节匹配排除主题的候选文档的得分,确保排除效果的安全性和稳定性。这一方案在保持索引不变的基础上,实现了对排除查询的高效处理,突破了传统微调和索引重建的限制,为深度检索模型提供了新的调控机制。

方法详解

  • �� 查询经过排除检测器,识别是否存在排除主题,若检测到则激活排除适配器,否则返回原始排名;
  • �� 排除检测器基于对比学习,训练识别查询中的排除词汇,利用标注的正负样本进行监督,确保高准确率;
  • �� 排除适配器对候选短名单中的每个文档进行重新嵌入,学习区分包含排除主题的文档与相关文档的差异;
  • �� 通过Evidence评分,衡量每个候选文档与排除主题的匹配强度,利用无参数的规则对匹配强度高的候选进行降权;
  • �� 降权采用动态阈值(基于均值和标准差),确保在不同查询场景下的适应性,避免误伤相关文档;
  • �� 最后,系统进行候选文档的硬性降级,最多移除三个最强匹配排除主题的候选,确保排名的稳定性。

实验设计

实验采用六个公开数据集,包括ExcluIR、FiQA、TREC-COVID、ESGenius、EDGAR和EUR-Lex,涵盖法律、金融、医疗等多个领域。对比模型包括原始冻结索引、微调模型(LoRA和全模型微调)以及查询端适配器。评估指标主要为排除成功@10、布尔否定准确率和无害检索的nDCG@10。所有模型在相同的硬件环境下训练,超参数如学习率、训练轮数和适配器规模均统一设置,确保公平性。还进行了消融实验,验证检测器和降权规则的贡献。系统在不同数据集和模型骨干上的表现均优于对比方法,特别是在排除成功率方面,显著优于微调和重排序方案。

结果分析

EXCISE在六个数据集上均实现了优异的排除效果,排除成功@10平均提升超过0.63,最大达到0.69以上。在ExcluIR数据集上,排除成功率从0.058提升到0.691,布尔否定准确率从0.25-0.29跃升至0.90-0.92,验证了其在复杂排除场景中的有效性。与微调模型相比,EXCISE无需索引重建,且在保持普通检索性能(nDCG@10不降低)方面表现出色。消融实验显示,检测器的识别准确率达到94%以上,Evidence评分和降权规则共同作用,确保排除效果的稳健性。整体结果证明,系统在多领域、多任务环境中均具备良好的适应性和扩展性。

应用场景

该技术可广泛应用于法律、医疗、金融等行业的文档检索系统中,尤其适合需要严格排除敏感或不相关内容的场景。系统无需索引重建,便于在动态环境中快速部署和调整,提升检索的灵活性和控制力。未来,结合多模态信息和更复杂的排除逻辑,有望实现更智能的内容过滤和个性化推荐,为行业提供更安全、更高效的检索解决方案。

局限与展望

系统依赖于排除检测器的准确性,若检测器误判或漏检,可能导致排除效果不理想。此外,候选短名单的限制意味着未在初始候选中目标文档时,系统无法补救,影响召回率。在极端长文本或高噪声环境下,Evidence评分的稳定性可能下降,影响降权效果。未来需要引入更鲁棒的特征表示和多模态信息融合,以提升系统在复杂场景中的表现。

通俗解读 非专业人士也能看懂

想象你在图书馆找书,你希望找到关于“电动汽车”的资料,但又不想看到关于“特斯拉”的内容。传统的方法就像你用眼睛扫一遍所有书名,然后把不想看的书放到一边,但有时候那些书名会让你误以为它们是你要找的内容,或者你会漏掉一些重要的书。现在,EXCISE就像有一个聪明的助手,他能听懂你说的话,知道你不想看“特斯拉”的内容,然后帮你把那些书自动放到一边,让你只看到你真正感兴趣的资料。这种助手不用重新整理所有书,只是在你问的时候,临时帮你筛选,既快又准。它的秘密在于:它能听懂你说的“不要特斯拉”,并且知道哪些书是关于“特斯拉”的,然后在你浏览的时候,把那些书的排名降低,确保你不会被它们迷惑。这样一来,你就能更轻松、更准确地找到你需要的资料,而不用担心被不相关的内容干扰。

简单解释 像给14岁少年讲一样

想象你在学校图书馆找资料,你想找到关于“足球”的书,但又不想看到关于“梅西”的内容。以前的方法就像你随便翻书,把你不想看的“梅西”相关的书也翻到前面,让你误以为它们是你要找的。现在,有个聪明的机器人助手,它能听懂你说:‘我想找足球,但不要梅西的资料’,然后它会帮你把那些关于梅西的书放到后面,或者降低它们的排名。这样,你就能更快找到真正关于足球的书,而不用担心被那些你不想看的内容迷惑。这个机器人助手不用重新整理所有书,只是在你问的时候,临时帮你筛选,把不想看的内容排到后面。它的秘密在于:它能理解你说的“不要梅西”,知道哪些内容是你不想要的,然后在你浏览时,把那些内容的排名降低,让你更容易找到想要的资料。这样一来,你的搜索变得更聪明、更贴心,也更省事。

原文摘要

Late-interaction retrievers handle exclusion queries poorly. When a user asks for X but not Z, the additive MaxSim score promotes documents covering Z, a problem we call exclusion inversion. We show that no readout of the frozen vectors recovers the constraint, because the difficulty lies in identifying the excluded topic, which depends on the query alone. EXCISE operates at query time and corrects the inversion while leaving the index frozen. Two query-side modules totalling 1.5M parameters identify the topic and re-embed a 100-document shortlist, and a parameter-free rule demotes candidates matching that topic. Across six collections and three backbones, EXCISE is the strongest system in all eighteen backbone-collection cells against that backbone's own frozen and fine-tuned baselines. It raises exclusion success@10 on ExcluIR from 0.058 to 0.691 and raises Boolean NOT accuracy from 0.25-0.29 to 0.90-0.92. Pooled over 1,860 queries, it outperforms every fine-tuned cross-encoder, each of which loses no-harm nDCG@10, whereas EXCISE matches its frozen baseline on its strongest backbone. We release X-BENCH, a tiered benchmark of explicit, implicit, and compound exclusions with no-harm and Boolean controls.

cs.IR

参考文献 (20)

EDGAR-CORPUS: Billions of Tokens Make The World Go Round

Lefteris Loukas, Manos Fergadiotis, Ion Androutsopoulos 等

2021 55 引用 ⭐ 高影响力 查看解读 →

WWW'18 Open Challenge: Financial Opinion Mining and Question Answering

Macedo Maia, S. Handschuh, A. Freitas 等

2018 460 引用 ⭐ 高影响力

Towards General Text Embeddings with Multi-stage Contrastive Learning

Zehan Li, Xin Zhang, Yanzhao Zhang 等

2023 966 引用 ⭐ 高影响力 查看解读 →

C-Pack: Packed Resources For General Chinese Embeddings

Shitao Xiao, Zheng Liu, Peitian Zhang 等

2023 772 引用 ⭐ 高影响力 查看解读 →

Fact or Fiction: Verifying Scientific Claims

David Wadden, Kyle Lo, Lucy Lu Wang 等

2020 775 引用 ⭐ 高影响力 查看解读 →

Relevance feedback in information retrieval

J. Rocchio

1971 3525 引用 ⭐ 高影响力

Promptriever: Instruction-Trained Retrievers Can Be Prompted Like Language Models

Orion Weller, Benjamin Van Durme, Dawn J. Lawrie 等

2024 59 引用 ⭐ 高影响力 查看解读 →

MultiEURLEX - A multi-lingual and multi-label legal document classification dataset for zero-shot cross-lingual transfer

Ilias Chalkidis, Manos Fergadiotis, Ion Androutsopoulos

2021 159 引用 ⭐ 高影响力 查看解读 →

Retrieval of the Best Counterargument without Prior Topic Knowledge

Henning Wachsmuth, S. Syed, Benno Stein

2018 210 引用 ⭐ 高影响力

BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Jacob Devlin, Ming-Wei Chang, Kenton Lee 等

2019 119054 引用 查看解读 →

Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval

Lee Xiong, Chenyan Xiong, Ye Li 等

2020 1670 引用 查看解读 →

INSTRUCTIR: A Benchmark for Instruction Following of Information Retrieval Models

Hanseok Oh, Hyunji Lee, Seonghyeon Ye 等

2024 37 引用 查看解读 →

Dense Passage Retrieval for Open-Domain Question Answering

Vladimir Karpukhin, Barlas Oğuz, Sewon Min 等

2020 6539 引用 查看解读 →

What BERT Is Not: Lessons from a New Suite of Psycholinguistic Diagnostics for Language Models

Allyson Ettinger

2019 682 引用 查看解读 →

Reproducing NevIR: Negation in Neural Information Retrieval

Coen van den Elsen, Francien Barkhof, Thijmen Nijdam 等

2025 14 引用 查看解读 →

Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference

Benjamin Warner, Antoine Chaffin, Benjamin Clavié 等

2024 751 引用 查看解读 →

Task-aware Retrieval with Instructions

Akari Asai, Timo Schick, Patrick Lewis 等

2022 140 引用 查看解读 →

PLAID: An Efficient Engine for Late Interaction Retrieval

Keshav Santhanam, O. Khattab, Christopher Potts 等

2022 175 引用 查看解读 →

Passage Re-ranking with BERT

Rodrigo Nogueira, Kyunghyun Cho

2019 1531 引用 查看解读 →

Document Ranking with a Pretrained Sequence-to-Sequence Model

Rodrigo Nogueira, Zhiying Jiang, Ronak Pradeep 等

2020 837 引用 查看解读 →