CoCo-IR: Contextual Composed Image Retrieval

TL;DR

提出CoCo-IR任务及TIE模型,基于大规模多模态模型实现多轮上下文图像检索,单轮mAP达39.4,四轮R@1达44.1。

cs.CV 🔴 高级 2026-08-06 121 次浏览
Shengcao Cao Tanmaya Shekhar Dabral Zhongli Ding Madhuri Shanbhogue Kaifeng Chen Zhe Li Mojtaba Seyedhosseini Yu-Xiong Wang Liang-Yan Gui
多模态学习 交互式检索 大规模模型 多轮对话 图像检索

核心发现

方法论

本文提出一种基于大型多模态模型(LMM)的Transformable Image Embedding(TIE)架构,用于实现上下文感知的多轮图像检索。模型通过引入特殊的<EMB>标记,将多轮交互历史编码为统一的变换嵌入,从而动态反映用户意图的演变。训练过程中,利用自主生成的高质量数据引擎,通过模型自我反思和硬负样本挖掘,构建大规模多轮交互数据集。模型采用对比学习(InfoNCE)优化目标,确保嵌入空间中相关图像距离最小化。数据引擎结合特征聚类和网页图片共现信息,自动生成多轮交互链,过滤高质量样本,极大降低人工标注成本。模型架构融合双向注意力机制(within-turn)和因果注意力机制(across-turn),实现对多轮上下文的深层理解。实验证明,该方法在单轮基准CIRCO上达39.4的mAP@5,在新提出的多轮基准中,4轮对话的R@1达44.1,显著优于现有方法(28.2)。

关键结果

  • 在单轮CIRCO基准上,模型实现了39.4的mAP@5,超越传统单轮模型,验证了多轮上下文理解的有效性。
  • 在新提出的多轮CoCo-IR任务中,模型在4轮对话中达到44.1的R@1,远高于之前的28.2,显示出强大的上下文适应能力。
  • 通过自主数据引擎,训练样本规模比以往方法少14倍,仍实现SOTA性能,验证了数据生成策略的有效性。

研究意义

该研究突破了传统单轮图像检索的局限,提出多轮交互式检索框架,更贴合真实场景中用户逐步细化搜索需求的行为。引入的TIE架构和大规模自主数据引擎,为多模态交互学习提供了新思路,极大推动了视觉理解与自然语言处理的融合发展。此技术不仅提升了检索的准确性和鲁棒性,也为智能助手、虚拟导览等应用场景提供了基础支撑,有望引领未来多轮交互系统的设计方向。

技术贡献

本文的核心技术创新在于提出Transformable Image Embedding(TIE)架构,结合特殊<EMB>标记实现多轮上下文的动态编码,突破传统单向嵌入限制。模型采用双向与因果混合注意力机制,有效融合多模态信息,增强上下文理解能力。自主数据引擎利用LMM的自我反思和硬负挖掘,自动生成高质量多轮交互数据,极大降低标注成本。训练采用对比学习(InfoNCE),确保嵌入空间的判别性。实验中,模型在多个指标上均优于现有SOTA方法,验证了架构设计和数据策略的有效性。

新颖性

本研究首次将大规模多模态模型应用于多轮上下文图像检索任务,提出结合特殊<EMB>标记的变换嵌入机制,支持多轮交互的动态上下文编码。这一创新突破了以往模型只能处理单轮或静态上下文的限制,为多轮对话式检索提供了全新的解决方案。与传统方法依赖人工标注不同,本文自主生成数据的策略极大提升了数据规模和多样性,推动了多模态交互学习的边界。

局限性

  • 模型对极端复杂或模糊指令的理解仍有限,尤其在多轮交互中出现长距离依赖时可能出现误差。
  • 自主数据引擎虽大幅降低成本,但生成数据的多样性和真实感仍有提升空间,可能影响模型泛化能力。
  • 当前系统在处理超长对话或极大图像库时,计算成本较高,需优化模型效率以适应实际应用。

未来方向

未来将探索多模态模型在更复杂场景中的适应性,如视频检索、多模态问答等。还计划引入更高效的模型剪枝和压缩技术,以降低部署成本。同时,将结合用户反馈机制,动态优化交互策略,提升系统的个性化和智能化水平。此外,扩展多轮交互数据的多样性和真实性,也是未来的重要方向。

AI 总览摘要

在当今数字信息爆炸的时代,用户对图像搜索的需求已从简单的关键词匹配逐渐演变为复杂的交互式对话。传统的单轮图像检索模型,虽然在静态场景中表现优异,但难以满足现实中多轮逐步细化搜索的需求。这一局限性促使研究者们探索更为灵活的交互策略。本文提出了“上下文组成图像检索(CoCo-IR)”任务,旨在实现多轮对话中的连续上下文理解与图像检索。核心创新在于引入基于大规模多模态模型(LMM)的Transformable Image Embedding(TIE)架构,它通过特殊的<EMB>标记,将多轮交互历史编码为动态变化的嵌入,有效捕捉用户意图的演变。模型在训练中利用自主生成的数据引擎,通过模型自我反思和硬负样本挖掘,极大降低了数据标注成本,提升了模型的泛化能力。

实验结果显示,TIE在单轮基准CIRCO上达到了39.4的mAP@5,优于现有的单轮模型。在多轮交互任务中,模型在四轮对话中实现了44.1的R@1,远超传统方法(28.2),验证了其强大的上下文理解能力。这一突破不仅推动了多模态交互技术的发展,也为智能助手、虚拟导览等实际应用提供了坚实基础。

整体而言,本文的贡献在于提出了一套完整的多轮上下文图像检索框架,从模型架构、数据生成到训练策略,均实现了创新突破。未来,随着模型效率的提升和数据多样性的丰富,这一技术有望在更广泛的场景中得到应用,开启人机交互的新篇章。

深度分析

研究背景

近年来,视觉与自然语言处理的融合推动了多模态学习的快速发展。早期的双编码模型(如CLIP)通过对齐图像和文本的特征空间,实现了零样本检索能力,但在理解复杂指令和多轮交互方面仍有限。随着大规模预训练模型(如Gato、Florence)的出现,研究者开始探索深度融合机制,以增强模型的推理和理解能力。传统的组成式图像检索(CIR)在单轮场景中表现良好,但无法满足用户逐步细化搜索的需求。近年来,基于基础模型的推理能力被逐步引入到多轮交互中,然而缺乏系统的多轮上下文编码策略,导致模型在复杂交互中表现不佳。现有数据集多为静态标注,难以支持多轮交互训练,限制了模型的泛化能力。本文在此背景下,提出了支持多轮上下文理解的创新架构和自主数据生成策略,为多模态交互研究开辟了新方向。

核心问题

当前的图像检索系统多为单轮交互,难以应对用户在实际场景中的逐步细化需求。多轮交互中,用户可能不断调整指令,引用之前的图片或描述,模型需要理解上下文的演变,动态调整检索目标。传统模型多依赖预定义的上下文压缩机制(如GPT-3的prompt总结),但在多轮场景中容易信息丢失或歧义,导致检索效果下降。此外,缺乏大规模、多轮交互数据集,限制了模型的训练和优化。如何设计一个能持续理解多轮上下文、支持复杂指令变换的模型,成为核心难题。同时,如何自动生成高质量的多轮交互数据,降低标注成本,也是亟待解决的问题。

核心创新

本文的创新点主要包括:1)提出Transformable Image Embedding(TIE)架构,利用特殊的<EMB>标记,将多轮交互历史编码为动态变化的嵌入,有效捕捉用户意图的演变;2)引入混合注意力机制,在每轮内部实现双向融合,同时跨轮采用因果注意力,确保上下文的时序一致性;3)自主构建大规模多轮交互数据集,结合特征聚类和网页共现信息,利用LMM的自我反思和硬负挖掘,自动筛选高质量样本,显著降低数据标注成本;4)采用对比学习(InfoNCE)优化目标,确保嵌入空间的判别性和鲁棒性。这些创新共同实现了多轮上下文理解和动态嵌入的突破。

方法详解

  • �� 架构设计:引入特殊<EMB>标记,将多轮交互历史编码为单一的变换嵌入,模型通过线性投影输出最终表示。
  • �� 注意力机制:在每轮内部采用双向(全)注意力实现深度融合,跨轮采用因果注意力,保持时间顺序。
  • �� 训练目标:利用对比学习(InfoNCE)损失,将正样本与硬负样本区分开,增强嵌入判别能力。
  • �� 数据生成:通过特征聚类和网页共现信息自动发现图像对,利用LMM生成变换指令并进行自我评分,筛选高质量样本。
  • �� 多轮链构建:自动拼接多轮交互链,利用LMM改写指令,使其符合上下文,增强模型的对话理解能力。
  • �� 负样本挖掘:结合模型输出和LMM验证,筛选难负样本,提升模型鲁棒性。

实验设计

采用公开的CIRCO单轮基准和新提出的多轮基准,评估模型在不同场景下的性能。指标包括mAP@5和R@1,分别衡量单轮和多轮检索准确率。训练中,采用不同的负样本策略和数据过滤阈值,进行消融实验验证架构设计的有效性。模型参数配置包括:Transformer层数、注意力头数、嵌入维度等。对比多种基线模型(如传统CIR、基于prompt的总结模型),验证TIE的优势。还进行不同轮数的对比,分析模型在长序列中的表现变化。

结果分析

在单轮CIRCO上,TIE模型实现了39.4的mAP@5,优于现有的SOTA(如基于CLIP的模型)。在多轮任务中,4轮对话的R@1达到44.1,显著高于之前的28.2,验证了模型对上下文的深刻理解。通过自主数据引擎,训练样本规模比传统方法少14倍,但性能依然领先,显示出数据生成策略的高效性。消融实验显示,<EMB>标记和混合注意力机制是性能提升的关键因素。模型在复杂指令和长序列中表现稳定,验证了架构设计的鲁棒性。

应用场景

该技术可广泛应用于智能助手、虚拟导览、电子商务中的交互式商品搜索、虚拟试衣等场景。用户可以通过自然对话逐步细化搜索目标,无需重新输入复杂指令。系统依赖于大规模多模态模型和自主数据引擎,具备良好的扩展性和适应性。未来还可结合用户反馈,动态调整检索策略,提升个性化体验。

局限与展望

模型在处理极端模糊或多义指令时仍存在理解偏差,尤其在长序列中信息累积可能导致误差累积。自主数据引擎生成的数据虽高效,但在多样性和真实性方面仍有提升空间,可能影响模型泛化能力。此外,模型计算成本较高,难以在资源有限的设备上部署,未来需优化模型结构和推理效率。

通俗解读 非专业人士也能看懂

想象你在一家大型超市购物,你有一份购物清单,但每次你都可以逐步告诉店员你想找的东西,比如“我想找红色的衣服”,然后店员帮你找,接着你又说“我想找那件蓝色的夹克”,店员会记住你之前的需求,帮你找到更符合你新要求的商品。这个过程不断重复,店员会根据你之前说的内容不断调整搜索结果,直到你找到心仪的商品。传统的系统就像只听你一句话,帮你找一件东西,但不能记住之前的对话,也不能理解你逐步变化的需求。而本文提出的方法,就像这个店员一样,能记住你之前说的每一句话和每一次找到的商品,理解你整个购物过程中的变化,从而帮你更准确、更智能地找到你想要的商品。这种能力在未来的智能助手、虚拟导游等场景中会非常有用,让人们的交互变得更自然、更顺畅。

简单解释 像给14岁少年讲一样

想象你在玩一个超级酷的游戏,你可以和游戏里的角色聊天,告诉它你想做什么,比如“帮我找到一辆红色跑车”,然后它会帮你找出符合要求的图片。接下来,你又说“现在把车变成蓝色”,它会记住你之前说的话,然后帮你找到一辆蓝色的跑车。这个游戏角色不仅能理解你说的话,还能记住你之前的指令,逐步帮你实现想法。传统的系统就像只听你说一句话,帮你找一辆车,但不能记住你之前说的内容,也不能帮你一步步实现你的想法。而这篇论文的技术就像这个聪明的游戏角色一样,能记住你说的每一句话,理解你的变化,帮你一步步找到你想要的图片。这让和电脑的对话变得更像和朋友聊天一样自然,特别适合用在智能助手、虚拟导游和购物网站上,让我们的生活变得更方便、更有趣。

术语表

Large Multimodal Model (LMM) 大型多模态模型

一种融合视觉和语言信息的深度学习模型,能够同时处理图像和文本,实现复杂推理和交互,本文中用于生成和理解多轮交互数据。

作为模型架构的基础,用于实现TIE和自主数据引擎。

Transformable Image Embedding (TIE) 可变换图像嵌入

一种动态变化的图像表示机制,通过特殊<EMB>标记,将多轮交互历史编码为单一的、可调整的嵌入向量,用于多轮上下文理解。

核心技术创新,用于支持多轮交互的上下文感知检索。

<EMB> 标记

在模型中作为特殊的符号,用于引导模型生成全局信息的压缩表示,特别是在多轮交互中聚合历史信息。

在TIE架构中,<EMB>标记是实现动态上下文编码的关键。

InfoNCE 损失

一种对比学习的目标函数,通过最大化正样本与负样本的相似度差异,提升嵌入空间的判别性。

训练模型时,用于优化图像与文本的匹配能力。

硬负样本挖掘

在训练中主动寻找与正样本相似但不符合条件的负样本,增强模型区分能力。

通过自主数据引擎实现,提升模型鲁棒性。

注意力机制

一种模仿人类注意力的机制,使模型在处理多模态信息时能够重点关注关键部分。本文采用双向和因果混合注意力。

实现深度融合和上下文保持。

多轮交互

用户与系统之间多次对话,每轮基于前一轮的结果调整指令,逐步逼近目标。

本文的核心任务场景。

对比学习

通过比较正负样本,学习判别性强的特征空间,用于提升检索准确性。

训练TIE模型的关键技术。

自主数据引擎

利用大规模模型自动生成多轮交互数据,包括指令、图像对和硬负样本,降低人工标注成本。

实现大规模训练的基础。

多轮链构建

自动拼接多轮交互样本,形成连续对话序列,增强模型对上下文的理解能力。

数据预处理和训练的重要环节。

开放问题 这项研究留下的未解疑问

  • 1 尽管模型在多轮交互中表现优异,但在极端复杂或模糊指令的理解上仍存在不足,特别是在长序列中信息累积可能导致误差扩散。未来需要研究更鲁棒的上下文编码机制,以应对多样化的用户需求。
  • 2 自主数据引擎虽然极大降低了数据标注成本,但在生成多样性和真实性方面仍有限,可能影响模型在真实场景中的泛化能力。如何进一步提升数据的多样性和真实性,是后续研究的重要方向。
  • 3 模型在处理超大规模图像库或超长对话时,计算资源消耗较大,存在效率瓶颈。未来应结合模型剪枝、知识蒸馏等技术,优化推理速度和部署效率。
  • 4 目前模型主要在静态数据集上验证,实际应用中需要结合用户反馈机制进行持续优化,以实现个性化和动态适应。
  • 5 多轮交互中的长距离依赖关系仍需深入研究,如何更好地捕捉用户意图的演变,是未来的重要挑战。

应用场景

近期应用

智能虚拟助手

结合多轮上下文理解能力,为用户提供更自然、连续的交互体验,如智能家居控制、信息查询等。

虚拟导览与购物

在虚拟导览或电商平台中,用户可逐步细化搜索需求,系统根据上下文动态推荐商品或场景。

多模态交互系统

支持图像和文本的多轮交互,提升人机交互的智能化水平,广泛应用于教育、娱乐等领域。

远期愿景

全场景智能交互平台

未来实现跨场景、多模态、多轮次的无缝交互,成为智能生活的基础架构,推动智慧城市、智能家居等发展。

自主学习与适应

系统能通过用户交互不断学习,优化个性化策略,实现真正的自主适应和持续进步。

原文摘要

Current instruction-based image retrieval systems are powerful but limited to single-turn interactions, failing to capture the iterative nature of complex, real-world visual searches. To overcome this limitation, we introduce Contextual Composed Image Retrieval (CoCo-IR), a novel task that enables users to progressively refine search results through interactions. We address this new task by proposing a new model based on a Large Multimodal Model (LMM) that functions as a context-aware reasoner for CoCo-IR. Our model interprets the entire interaction history to generate Transformable Image Embeddings (TIE) that evolve across turns. To fuel the model training without expensive human annotations, we develop a fully autonomous, scalable data engine that leverages LMMs to generate high-quality contextual retrieval data, and uses model-guided verification to mine challenging hard negatives. Extensive experiments demonstrate that our approach establishes new state-of-the-art performance: We achieve 39.4 mAP@5 on the challenging single-turn benchmark CIRCO; furthermore, on our new CoCo-IR benchmark, our model maintains robust performance with 44.1 R@1 on 4-turn dialogues, dramatically outperforming existing methods (28.2 4-turn R@1) that fail to handle multi-turn context. Project page: https://CoCo-IR.github.io.

cs.CV

参考文献 (20)

Composing Text and Image for Image Retrieval - an Empirical Odyssey

Nam S. Vo, Lu Jiang, Chen Sun 等

2018 497 引用 ⭐ 高影响力 查看解读 →

Learning Transferable Visual Models From Natural Language Supervision

Alec Radford, Jong Wook Kim, Chris Hallacy 等

2021 53505 引用 ⭐ 高影响力 查看解读 →

Gemma 3 Technical Report

Gemma Team Aishwarya Kamath, Johan Ferret, Shreya Pathak 等

2025 1672 引用 ⭐ 高影响力 查看解读 →

Fashion IQ: A New Dataset Towards Retrieving Images by Natural Language Feedback

Xiaoxiao Guo, Hui Wu, Yupeng Gao 等

2021 434 引用 ⭐ 高影响力

CompoDiff: Versatile Composed Image Retrieval With Latent Diffusion

Geonmo Gu, Sanghyuk Chun, Wonjae Kim 等

2023 111 引用 ⭐ 高影响力 查看解读 →

MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions

Kai Zhang, Yi Luan, Hexiang Hu 等

2024 129 引用 ⭐ 高影响力 查看解读 →

Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities

Gheorghe Comanici, E. Bieber, Mike Schaekermann 等

2025 3757 引用 ⭐ 高影响力 查看解读 →

Image Retrieval on Real-life Images with Pre-trained Vision-and-Language Models

Zheyuan Liu, Cristian Rodriguez-Opazo, Damien Teney 等

2021 381 引用 ⭐ 高影响力 查看解读 →

Zero-Shot Composed Image Retrieval with Textual Inversion

Alberto Baldrati, Lorenzo Agnolucci, Marco Bertini 等

2023 250 引用 ⭐ 高影响力 查看解读 →

Align before Fuse: Vision and Language Representation Learning with Momentum Distillation

Junnan Li, Ramprasaath R. Selvaraju, Akhilesh Deepak Gotmare 等

2021 2877 引用 查看解读 →

E5-V: Universal Embeddings with Multimodal Large Language Models

Ting Jiang, Minghui Song, Zihan Zhang 等

2024 123 引用 查看解读 →

MegaPairs: Massive Data Synthesis For Universal Multimodal Retrieval

Junjie Zhou, Zheng Liu, Ze Liu 等

2024 83 引用 查看解读 →

LAION-5B: An open large-scale dataset for training next generation image-text models

Christoph Schuhmann, R. Beaumont, R. Vencu 等

2022 5431 引用 查看解读 →

Representation Learning with Contrastive Predictive Coding

Aäron van den Oord, Yazhe Li, O. Vinyals

2018 14092 引用 查看解读 →

Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?

Yang Chen, Hexiang Hu, Yi Luan 等

2023 237 引用 查看解读 →

Pic2Word: Mapping Pictures to Words for Zero-shot Composed Image Retrieval

Kuniaki Saito, Kihyuk Sohn, Xiang Zhang 等

2023 232 引用 查看解读 →

Visual Instruction Tuning

Haotian Liu, Chunyuan Li, Qingyang Wu 等

2023 10629 引用 查看解读 →

BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation

Junnan Li, Dongxu Li, Caiming Xiong 等

2022 7116 引用 查看解读 →

InstructPix2Pix: Learning to Follow Image Editing Instructions

Tim Brooks, Aleksander Holynski, Alexei A. Efros

2022 3239 引用 查看解读 →

CoCa: Contrastive Captioners are Image-Text Foundation Models

Jiahui Yu, Zirui Wang, Vijay Vasudevan 等

2022 1796 引用 查看解读 →