Bottleneck Tokens for Unified Multimodal Retrieval

TL;DR

引入瓶颈令牌(BToks)解决多模态检索中的结构性问题,在MMEB-V2上取得59.0分。

cs.LG 🔴 高级 2026-04-13 12 次浏览
Siyu Sun Jing Ren Zhaohe Liao Dongxiao Mao Xiangyuan Ren Yiyi Zhang Haohua Zhao Weixiong Lin Jiang Shaohua Liqing Zhang Yuchao Zheng
多模态检索 瓶颈令牌 生成信息压缩 对比学习 语义压缩

核心发现

方法论

该研究提出了一种新的多模态检索方法,使用瓶颈令牌(BToks)作为显式池化机制,并结合生成信息压缩训练目标。BToks作为可学习的令牌,用于在多模态输入中聚合和压缩信息。生成信息压缩通过生成目标和结构化注意力约束提供令牌级别的监督。

关键结果

  • 在MMEB-V2基准测试中,BToks方法在2B规模模型中取得了59.0的总分,比VLM2Vec-V2提高了3.6分,尤其在视频问答任务上提升了12.6分。
  • 在图像任务中,BToks在图像问答和定位任务中分别提升了3.6和2.7分,显示了在语义复杂任务中的优势。
  • 消融实验显示,去除瓶颈令牌或生成目标会导致性能下降,验证了各组件的有效性。

研究意义

该研究在多模态检索领域具有重要意义,解决了现有方法中隐式池化的结构性缺陷。通过引入显式的瓶颈令牌和生成信息压缩,模型能够更好地在复杂语义任务中表现,推动了多模态检索技术的发展。

技术贡献

技术贡献包括:1) 引入瓶颈令牌作为专用的池化机制,解决了隐式池化的结构性问题;2) 提出生成信息压缩训练机制,为多模态信息压缩提供了令牌级别的监督;3) 在不增加推理复杂度的情况下,显著提升了模型在复杂任务中的表现。

新颖性

本研究首次将显式的瓶颈令牌与生成信息压缩相结合,提供了一个固定容量的信息瓶颈,用于多模态信息的聚合和压缩。这种方法与现有的隐式池化方法有根本性区别。

局限性

  • 在长序列输入的情况下,尽管瓶颈令牌提供了固定容量的池化机制,但仍可能面临信息丢失的问题。
  • 生成信息压缩的训练过程可能需要较长的计算时间。

未来方向

未来的研究方向包括:探索更高效的生成信息压缩机制,优化计算资源的使用;以及将该方法应用于更大规模的数据集和更多样化的任务中。

AI 总览摘要

多模态检索是将文本和视觉信息编码到共享嵌入空间中的关键技术。然而,现有方法依赖于隐式池化,导致信息聚合不充分。本文提出了一种新方法,使用瓶颈令牌(BToks)作为显式池化机制,并结合生成信息压缩训练目标。BToks作为可学习的令牌,用于在多模态输入中聚合和压缩信息。生成信息压缩通过生成目标和结构化注意力约束提供令牌级别的监督。

在MMEB-V2基准测试中,该方法在2B规模模型中取得了59.0的总分,比VLM2Vec-V2提高了3.6分,尤其在视频问答任务上提升了12.6分。这表明BToks能够在不增加推理复杂度的情况下,显著提升模型在复杂任务中的表现。

尽管如此,该方法在长序列输入的情况下可能面临信息丢失的问题。此外,生成信息压缩的训练过程可能需要较长的计算时间。未来的研究方向包括探索更高效的生成信息压缩机制,优化计算资源的使用。

深度分析

研究背景

多模态检索技术近年来得到了广泛关注,其核心在于将文本和视觉信息编码到共享的嵌入空间中。传统方法多依赖于隐式池化机制,如使用<EOS>令牌的隐藏状态作为全局表示。然而,这种方法在复杂语义任务中表现不佳,因为<EOS>令牌并非为信息聚合设计。

核心问题

现有的多模态检索方法在信息聚合上存在结构性缺陷,尤其在需要精确语义压缩的任务中表现不佳。隐式池化方法无法提供令牌级别的信息压缩指导,导致模型在复杂任务中难以有效捕捉查询意图。

核心创新

本文的核心创新在于引入瓶颈令牌(BToks)作为显式池化机制,解决了隐式池化的结构性问题。BToks作为可学习的令牌,用于聚合和压缩多模态信息。此外,生成信息压缩训练机制通过生成目标和结构化注意力约束,提供了令牌级别的监督。

方法详解

  • �� 引入瓶颈令牌(BToks),作为固定容量的显式池化机制。
  • �� 设计生成信息压缩训练目标,通过生成目标和结构化注意力约束提供令牌级别的监督。
  • �� 在推理阶段,仅处理输入和BToks,保持推理复杂度不变。

实验设计

实验在MMEB-V2基准测试上进行,涵盖78个数据集和9个元任务。使用2B规模的模型进行对比实验,评估BToks在不同任务中的表现。消融实验验证了各组件的有效性。

结果分析

BToks在MMEB-V2上取得59.0的总分,比VLM2Vec-V2提高3.6分,尤其在视频问答任务上提升12.6分。消融实验显示,去除瓶颈令牌或生成目标会导致性能下降。

应用场景

该方法可直接应用于多模态检索任务,如图像问答和视频检索。其显式池化机制对复杂语义任务尤为有效,具有广泛的行业应用潜力。

局限与展望

尽管BToks提供了显式池化机制,但在长序列输入的情况下可能面临信息丢失的问题。此外,生成信息压缩的训练过程可能需要较长的计算时间。

通俗解读 非专业人士也能看懂

想象一个工厂,负责将各种原材料加工成产品。传统方法就像是将所有材料放在一个大箱子里,期望最后的产品能代表所有材料的信息。而瓶颈令牌(BToks)就像是一个专门的加工车间,每个令牌负责处理特定的信息,确保最终的产品能准确反映原材料的特性。生成信息压缩就像是一个质量检测过程,确保每个加工车间都能有效地处理信息,避免信息丢失。

简单解释 像给14岁少年讲一样

想象你在玩一个需要同时处理文字和图片的游戏。传统方法就像是把所有信息丢给一个大脑,希望它能记住一切。但这很难!瓶颈令牌(BToks)就像是游戏中的小助手,每个助手负责处理一部分信息,确保你能快速找到答案。生成信息压缩就像是一个聪明的提示系统,帮助这些助手更好地工作。

术语表

Bottleneck Tokens (瓶颈令牌)

一组可学习的令牌,用于聚合和压缩多模态信息。

在论文中用于显式池化机制。

Generative Information Condensation (生成信息压缩)

结合生成目标和结构化注意力约束的训练机制。

用于提供令牌级别的监督。

Implicit Pooling (隐式池化)

使用<EOS>令牌的隐藏状态作为全局表示的方法。

传统多模态检索方法的缺陷。

Contrastive Fine-tuning (对比微调)

通过对比损失优化嵌入模型的方法。

用于模型的训练过程。

MMEB-V2

一个大规模多模态嵌入基准测试,涵盖78个数据集和9个元任务。

用于评估模型性能。

开放问题 这项研究留下的未解疑问

  • 1 如何在长序列输入中保持信息完整性?现有方法可能导致信息丢失,需要更高效的压缩机制。
  • 2 生成信息压缩的计算效率如何提升?当前方法可能需要较长的训练时间。

应用场景

近期应用

多模态检索

可用于图像问答和视频检索,提升复杂任务中的表现。

远期愿景

智能搜索引擎

通过改进的多模态检索技术,提升搜索引擎的语义理解能力。

原文摘要

Adapting decoder-only multimodal large language models (MLLMs) for unified multimodal retrieval faces two structural gaps. First, existing methods rely on implicit pooling, which overloads the hidden state of a standard vocabulary token (e.g., <EOS>) as the sequence-level representation, a mechanism never designed for information aggregation. Second, contrastive fine-tuning specifies what the embedding should match but provides no token-level guidance on how information should be compressed into it. We address both gaps with two complementary components. Architecturally, we introduce Bottleneck Tokens (BToks), a small set of learnable tokens that serve as a fixed-capacity explicit pooling mechanism. For training, we propose Generative Information Condensation: a next-token prediction objective coupled with a Condensation Mask that severs the direct attention path from target tokens to query tokens. All predictive signals are thereby forced through the BToks, converting the generative loss into dense, token-level supervision for semantic compression. At inference time, only the input and BToks are processed in a single forward pass with negligible overhead over conventional last-token pooling. On MMEB-V2 (78 datasets, 3 modalities, 9 meta-tasks), our approach achieves state-of-the-art among 2B-scale methods under comparable data conditions, attaining an Overall score of 59.0 (+3.6 over VLM2Vec-V2) with substantial gains on semantically demanding tasks (e.g., +12.6 on Video-QA).

cs.LG cs.AI