Promptriever: Instruction-Trained Retrievers Can Be Prompted Like Language Models

TL;DR

Promptriever为首个可用指令提示的检索模型,基于MS MARCO的500k实例训练,显著提升指令遵循能力。

cs.IR 🔴 高级 2024-09-17 39 次浏览
Orion Weller Benjamin Van Durme Dawn Lawrie Ashwin Paranjape Yuhao Zhang Jack Hessel
信息检索 指令调优 深度学习 大模型 检索增强

核心发现

方法论

本研究提出Promptriever,采用大规模指令增强的训练集(近50万实例)结合MS MARCO数据,通过在双编码器架构中引入指令条件,提升模型的指令遵循能力。训练过程中,结合正负指令样本,优化模型对复杂指令的响应能力。模型核心基于LLaMA-2 7B,利用指令生成、指令负样本挖掘等技术,增强模型对个别查询的指令适应性。训练目标为在保持标准检索性能的同时,提升对详细指令的响应和鲁棒性。

关键结果

  • 在FollowIR数据集上,Promptriever实现了14.3个百分点的p-MRR提升,达到最佳状态(SoTA),同时在nDCG指标上提升3.1点,表现优于传统检索模型。
  • 在InstructIR数据集上,模型对不同措辞和词汇变化的鲁棒性显著增强,Robustness@10提升12.9,显示出对查询表达多样性的适应能力。
  • 通过提示调优实现超参数搜索,模型在BEIR数据集上平均提升1.4点nDCG,验证了提示引导的调优有效性。

研究意义

该研究突破了检索模型仅依赖静态训练目标的局限,首次展示了基于自然语言指令的动态控制能力,为未来信息检索系统的个性化和可调性提供新思路。模型在保持高效的同时,增强了对复杂指令的理解和执行能力,有望推动智能问答、个性化推荐等应用的发展,缩短人机交互的距离。

技术贡献

提出基于大规模指令增强训练的双编码器检索模型,结合指令生成与负样本挖掘技术,显著提升模型对指令的响应能力。模型在保持传统检索性能的基础上,实现了指令条件下的可调控性,开启了检索模型与大模型指令调控的融合新路径。此方法为未来多任务、多指令场景下的检索系统提供了技术基础。

新颖性

首次将指令调优技术应用于密集检索模型,突破了传统检索模型对指令的忽视局限。通过实例级指令生成和负样本挖掘,模型能在多样化指令下保持高性能,体现出模型对自然语言指令的敏感性和适应性,推动检索模型的智能化发展。

局限性

  • 模型依赖大量高质量指令数据,生成和筛选过程复杂,训练成本较高,可能限制在资源有限环境中的应用。
  • 指令的多样性虽得到增强,但在极端复杂或模糊指令下,模型仍存在理解偏差的风险。
  • 当前模型主要基于双编码器架构,未来需探索跨编码器等更复杂结构以进一步提升性能。

未来方向

未来将拓展多模态指令调控能力,结合视觉或语音信息,提升多模态检索的指令理解。同时,探索更高效的指令生成与负样本挖掘技术,降低训练成本,增强模型在实际场景中的适应性。此外,结合自监督和少样本学习,推动模型在少数据环境下的指令调控能力。

AI 总览摘要

在信息检索领域,传统模型多依赖静态语义匹配,难以满足个性化和复杂指令的需求。本文提出Promptriever,一种基于大规模指令增强训练的密集检索模型,首次实现了像语言模型一样通过自然语言指令进行调控的能力。模型采用双编码器架构,基于LLaMA-2 7B,通过生成多样化指令和指令负样本,训练其在保持标准检索性能的同时,增强对详细指令的理解和响应能力。

实验结果显示,Promptriever在FollowIR和InstructIR等指令遵循数据集上,分别提升14.3和12.9个百分点的p-MRR和Robustness@10指标,显著优于传统检索模型和部分跨编码器模型。同时,模型在BEIR等外域数据集上,通过提示调优实现平均1.4点的性能提升,验证了其在零样本调优中的潜力。

该研究不仅突破了检索模型的调控边界,也为未来多任务、多指令场景下的智能检索系统奠定基础。Promptriever的设计理念强调模型对个性化指令的敏感性和适应性,推动了检索技术向更智能、更灵活的方向发展。未来,结合多模态信息和自监督技术,有望实现更广泛的应用场景,推动信息检索和人机交互的深度融合。

深度分析

研究背景

信息检索技术经过多年的发展,从早期的基于关键词匹配到语义向量检索,代表性方法包括BM25、DPR和ColBERT。近年来,深度学习模型如BERT和跨编码器模型极大提升了检索效果,但仍受限于静态训练目标,难以满足个性化和复杂指令的需求。指令调优技术在自然语言处理领域已广泛应用于生成和理解任务,但在检索中的探索较少。现有研究多集中在单一任务优化,缺乏对多样化指令的适应能力,限制了模型的灵活性和可控性。

核心问题

核心问题在于传统检索模型缺乏对用户复杂指令的理解和响应能力,难以实现动态调控和个性化检索。现有模型多依赖硬编码的规则或静态训练目标,无法灵活适应不同任务和用户需求,导致用户体验不佳。此外,模型对措辞变化的鲁棒性不足,容易受到词汇和表达方式的影响,限制了其在实际应用中的广泛部署。

核心创新

本研究提出Promptriever,创新点包括:1)引入实例级指令生成技术,结合大规模指令增强训练集,显著提升模型的指令遵循能力;2)采用负样本挖掘策略,使模型在多样化指令下学习区分相关与不相关的内容;3)利用提示调优实现超参数搜索,增强模型在不同场景下的适应性。这些创新突破了传统检索模型的静态局限,为模型的可调控性和泛化能力提供了新途径。

方法详解

  • �� 构建指令增强训练集:从MS MARCO数据出发,利用Llama-3-70B生成多样化指令,结合指令负样本挖掘,形成近50万实例。
  • �� 模型架构:采用基于LLaMA-2 7B的双编码器架构,输入为查询和指令,输出为相关性分数。
  • �� 训练策略:结合正负样本,通过最大化相关性和最小化不相关性,优化模型对指令的响应。
  • �� 指令生成:利用GPT-4和Llama-3生成多样化指令,确保覆盖不同风格和长度。
  • �� 指令负样本挖掘:筛选生成的负样本,确保模型学习区分相关与不相关内容。
  • �� 训练目标:在保持标准检索性能基础上,增强模型对复杂指令的理解和执行能力。

实验设计

在MS MARCO、BEIR、FollowIR和InstructIR数据集上进行评估。比较基线包括RepLLaMA、BM25和跨编码器模型。指标包括nDCG@10、MRR和p-MRR。训练中采用超参数调优,进行指令多样性和负样本挖掘的消融实验。模型在不同场景下的鲁棒性和指令遵循能力被系统测试,验证其在标准和指令调控任务中的性能。

结果分析

Promptriever在FollowIR数据集上,p-MRR提升14.3点,达到最新SOTA水平;在InstructIR上,Robustness@10提升12.9,表现出对表达多样性的强适应性。在BEIR零样本调优中,通过提示调优平均提升1.4点nDCG,验证其调控能力。模型在保持传统检索性能的同时,显著增强了指令遵循和鲁棒性,展现出优异的多任务适应性。

应用场景

该模型适用于智能问答、个性化推荐和多任务信息检索场景。用户可以通过自然语言指令动态调控检索目标,提升交互体验。企业可利用其调控能力实现个性化内容筛选和多任务处理,降低系统维护成本。未来,结合多模态信息,将进一步拓展其应用范围。

局限与展望

模型依赖大量高质量指令数据,生成和筛选成本较高,训练资源需求大。对极端模糊或复杂指令的理解仍有限,存在偏差风险。当前架构主要基于双编码器,未来需探索更复杂的模型结构以提升性能。

通俗解读 非专业人士也能看懂

想象你在一家厨房里做饭,传统的厨师只知道按照菜谱一步步操作,不能随意变换食材或调料。现在,Promptriever就像一个聪明的厨师,不仅能按照指令做菜,还能根据你的不同要求调整食谱,比如“少盐”、“多辣”或“只用有机食材”。它通过学习大量不同的指令和食谱,变得越来越灵活,能理解各种复杂的指示,帮你做出符合你口味的菜肴。这就像你告诉厨师“我想吃辣一点的麻婆豆腐”,它能立刻调整做法,满足你的需求。这个模型的核心在于,它不仅能记住菜谱,还能理解你说的各种特殊要求,变得像个会变魔术的厨师一样聪明。

简单解释 像给14岁少年讲一样

想象你在学校里,有个超级聪明的朋友,他不仅能帮你做作业,还能根据你的要求改变答案,比如“用简单的话说”或者“讲得更详细一点”。这个朋友就像Promptriever一样,它不仅能帮你找到信息,还能理解你说的特别要求。比如你问“哪种火山喷发我没见过?”,它能根据你的指示,帮你找到关于还没有被观察到的火山喷发类型的资料。它学会了很多不同的指令,知道怎么根据你的不同需求调整答案,就像你让朋友帮你做不同风格的作业一样。这样一来,信息变得更贴合你的需要,你也能更快找到想要的答案。

术语表

Instruction-tuning (指令调优)

指在模型训练中加入自然语言指令,使模型学会根据不同指令调整输出内容。技术上通过在训练数据中加入多样化指令和对应任务,增强模型的指令理解能力。

本文中,指令调优用于提升检索模型对复杂指令的响应能力。

Bi-encoder (双编码器)

一种神经网络架构,将查询和文档分别编码成向量,通过计算向量相似度实现检索。优点是检索速度快,适合大规模检索场景。

Promptriever采用基于LLaMA-2的双编码器架构。

MS MARCO

由微软发布的大规模网页检索数据集,包含查询、相关文档和负样本,用于训练和评估信息检索模型。

本研究使用MS MARCO作为基础训练数据集。

p-MRR (偏重指令遵循的平均排名指标)

一种衡量模型在指令遵循任务中排名性能的指标,范围从-100到100,数值越高表示越好。

用以评估Promptriever在FollowIR和InstructIR上的指令遵循效果。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升模型在极端复杂指令下的理解能力,以及减少生成负样本的成本和时间,是未来研究的关键。
  • 2 模型在多模态指令(如结合图像、语音)下的表现尚未充分探索,未来需结合多模态信息增强理解能力。

应用场景

近期应用

个性化搜索引擎

用户通过自然语言指令调节搜索偏好,实现更精准的内容推荐和信息检索。需要高质量指令数据和实时调控机制。

智能问答系统

结合Promptriever,提供基于复杂指令的答案,提升用户体验,适用于客服、教育等场景。

远期愿景

多模态智能交互

融合视觉、语音等多模态信息,打造更智能、更自然的人机交互系统,未来可实现全场景自主调控。

原文摘要

Instruction-tuned language models (LM) are able to respond to imperative commands, providing a more natural user interface compared to their base counterparts. In this work, we present Promptriever, the first retrieval model able to be prompted like an LM. To train Promptriever, we curate and release a new instance-level instruction training set from MS MARCO, spanning nearly 500k instances. Promptriever not only achieves strong performance on standard retrieval tasks, but also follows instructions. We observe: (1) large gains (reaching SoTA) on following detailed relevance instructions (+14.3 p-MRR / +3.1 nDCG on FollowIR), (2) significantly increased robustness to lexical choices/phrasing in the query+instruction (+12.9 Robustness@10 on InstructIR), and (3) the ability to perform hyperparameter search via prompting to reliably improve retrieval performance (+1.4 average increase on BEIR). Promptriever demonstrates that retrieval models can be controlled with prompts on a per-query basis, setting the stage for future work aligning LM prompting techniques with information retrieval.

cs.IR cs.CL cs.LG