LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models

TL;DR

提出LookME,通过层级检索和稀疏注入提升视觉-语言模型的多模态嵌入效果,显著优于文本专用方法。

cs.CV 🔴 高级 2026-07-14 38 次浏览
Zeyu Xu Xingzhong Hou Pengkai Guo Siling Lin Xiao Xu Menghua Zhai Haoyu Chen Yunke Zhang Fei Huang
多模态学习 层级检索 稀疏注入 视觉-语言模型 嵌入优化

核心发现

方法论

本文提出的LookME框架结合层级两级检索策略,利用粗到细的搜索机制,从大规模外部多模态嵌入表中高效检索相关信息。采用场景级和细粒度原语级两个层次,结合稀疏注入策略,动态选择关键嵌入,减少存储和计算负担。通过将嵌入存储在ROM中,实现模型的分区存储和按需加载,突破传统ID检索限制,支持连续多模态嵌入的高效检索。该方法在视觉任务中显著提升模型表现,验证了多模态嵌入增强的有效性。

关键结果

  • 在多个视觉基准测试中,LookME在精细对齐任务上超越文本专用的PLE方法,平均提升约2.8-3.9点分数。例如,在CV-Bench-3D任务中,得分从75.3提升至79.2,表现出优异的多模态融合能力。
  • 在大规模视觉问答和多模态理解任务中,LookME实现了约1.6到3.0的性能提升,尤其在多图像和视频任务中表现更为突出,验证了其跨模态增强的优势。
  • 通过层级检索和稀疏注入的结合,显著降低了模型参数和计算成本,同时保持甚至提升了模型的泛化能力和鲁棒性。

研究意义

该研究突破了传统基于ID的检索限制,为大规模多模态模型提供了高效的外部知识增强方案。通过支持ROM存储和按需加载,极大改善了资源受限环境中的部署难题,为未来视觉-语言模型的可扩展性和实用性奠定基础。其创新的层级检索和稀疏注入策略,为多模态信息融合提供了新的技术路径,有望推动多模态AI在自动驾驶、机器人、智能助手等领域的广泛应用。

技术贡献

技术上,本文首次将PLE架构扩展到多模态嵌入,提出层级两级检索机制,有效应对连续多模态嵌入的检索难题。引入稀疏注入策略,动态优先关键嵌入,减少存储和计算开销。模型支持分区存储,结合ROM和GPU的协同检索,突破了传统ID检索的限制,提供了高效、可扩展的多模态知识增强方案。这些创新为大规模多模态模型的部署和性能优化提供了新思路。

新颖性

本研究首次提出支持连续多模态嵌入的层级检索框架,突破了ID基础检索的局限,结合稀疏注入实现动态优先和跨层复用,显著提升了模型效率与性能。这在多模态模型中尚属首创,为未来多模态知识整合提供了新范式。

局限性

  • 当前方法在极端长序列或高复杂度场景下,检索效率可能受到影响,尤其在多模态嵌入极为庞大时,存储和检索成本仍有提升空间。
  • 模型在特定任务中对稀疏激活的依赖可能导致部分信息遗漏,影响极端场景下的表现。
  • 目前主要验证在视觉和跨模态任务,未来需扩展到音频、视频等其他模态,验证其普适性。

未来方向

未来将探索多模态嵌入的自适应层级划分策略,提升检索效率与准确性。计划结合更先进的稀疏激活机制,进一步降低存储和计算成本。此外,将扩展到多模态融合的多任务学习框架,推动多模态模型在实际场景中的广泛应用。

AI 总览摘要

随着视觉-语言模型(VLMs)在多模态理解中的快速发展,模型规模不断扩大,带来高昂的存储与计算成本。传统的Mixture-of-Experts(MoE)方法虽能实现参数高效激活,但在资源有限环境中部署仍受制于模型体积和延迟问题。近年来,Per-Layer Embedding(PLE)架构通过引入大规模外部嵌入表,利用只读存储(ROM)实现轻量级检索,极大缓解了模型扩展的瓶颈。然而,现有PLE方法主要针对文本嵌入,难以充分利用多模态丰富信息,限制了在视觉任务中的效果。针对这一挑战,本文提出了LookME框架,首次实现支持多模态嵌入的层级检索机制。该方法采用粗到细的两级检索策略,从场景级到原语级,结合稀疏注入,有效筛选关键嵌入,减少存储和计算负担。模型支持分区存储,嵌入存放在ROM中,按需加载,突破了ID检索的限制。大量实验验证了LookME在多个视觉基准上的优越表现,显著优于仅文本的PLE方法,为多模态模型的高效部署提供了新思路。未来,该框架有望在自动驾驶、机器人和智能助手等领域发挥重要作用,推动多模态AI的广泛应用。

深度分析

研究背景

多模态学习近年来取得突破,模型规模不断扩大,从BERT到GPT系列,再到大规模视觉-语言模型(如Florence、BLIP-2),推动了多模态理解的深度发展。代表性工作包括CLIP、ALIGN、Florence等,利用大规模对比学习实现跨模态对齐。随着参数规模增长,模型在性能上持续提升,但同时带来存储、计算和能耗的巨大压力。MoE架构通过专家路由实现参数稀疏激活,缓解了部分瓶颈,但在边缘设备部署时仍面临模型庞大和延迟问题。近年来,Google DeepMind提出的PLE架构引入外部知识嵌入表,利用ROM存储实现轻量检索,极大改善了模型的可扩展性。尽管如此,现有方法主要针对文本嵌入,难以充分利用多模态丰富的视觉信息,限制了其在视觉任务中的表现。多模态嵌入的连续性和高维特性,使得传统ID检索难以适应,亟需新的检索策略。

核心问题

现有PLE架构在多模态场景中存在两大难题:一是连续多模态嵌入缺乏离散ID,难以高效检索;二是模型参数和存储成本随着多模态信息丰富而迅速膨胀,限制了模型在资源有限环境中的应用。此外,传统的相似度检索和分类路由在大规模多模态嵌入表中效率低下,难以实现快速、精确的外部知识增强。这些问题制约了多模态模型的实际部署和性能提升,亟需创新的检索机制和存储策略。

核心创新

本文提出的LookME架构创新点在于:1)引入层级两级检索策略,将大规模连续多模态嵌入划分为场景级和原语级,显著提升检索效率和准确性;2)结合稀疏注入策略,动态优先关键嵌入,减少冗余,提升模型效率;3)支持ROM存储与按需加载,突破ID检索的限制,实现连续多模态嵌入的高效利用;4)在模型中引入跨层复用机制,减少参数冗余,增强模型泛化能力。这些创新共同推动多模态知识整合的技术发展,为大规模多模态模型的高效部署提供了新路径。

方法详解

  • �� 构建多模态外部嵌入表,将其存储在ROM中,支持分区存储与按需加载。• 设计两级检索机制:场景级(粗粒度)和原语级(细粒度),利用场景特征进行粗分类,再进行细粒检索。• 利用场景嵌入和相似度匹配实现场景级路由,采用Gumbel-Softmax进行可微化。• 在原语级,通过MLP和余弦相似度筛选关键原语,结合多尺度图像特征实现细粒度检索。• 结合稀疏激活机制(SKA),在每个位置动态决定是否激活检索路径,减少计算。• 跨层稀疏激活,将LookME层的增强信息向非LookME层传递,避免重复检索。• 训练过程中,联合优化嵌入表和模型参数,推理时实现离线存储和快速检索。

实验设计

采用多源公开图文数据集(如COCO、Visual Genome、LAION-400M)进行预训练,比较基线包括Qwen25-VL、纯文本PLE、Engram和MeKi。评估指标涵盖视觉问答、图像理解、多模态检索等15个任务。模型参数一致,采用512维嵌入,调优超参数如场景数Ns=512、原语数Np=256。通过消融实验验证层级检索和稀疏注入的贡献,分析不同尺度和层级配置对性能的影响。

结果分析

在多个基准测试中,LookME在CV-Bench-3D、HallusionBench等任务中提升了最大3.9点分数,平均提升2.8点,优于纯文本PLE和其他对比模型。在多模态理解和视觉问答中,性能提升显著,验证了多模态嵌入的有效融合。稀疏注入和跨层复用策略有效降低参数和计算成本,模型在保持高性能的同时实现了资源节约。

应用场景

该方法适用于自动驾驶、机器人视觉、智能助手等场景,能在边缘设备上实现高效多模态理解。通过ROM存储和按需加载,降低硬件要求,提升部署灵活性。未来可结合多模态任务自适应层级调度,推动多模态AI的普及。

局限与展望

目前方法在极端长序列或高复杂度场景下检索效率仍有待提升,模型对稀疏激活的依赖可能导致信息遗漏,且多模态嵌入的连续性和高维特性仍是挑战。未来需优化检索策略,扩展到更多模态,增强鲁棒性。

通俗解读 非专业人士也能看懂

想象你在一个大型工厂里工作,工厂里有许多不同的车间(场景),每个车间负责不同的任务(比如装配、包装、检验)。每个车间里有很多工人(原语),他们负责具体的工作。为了让工厂运转得更快、更智能,工厂管理者设计了一个智能系统,可以根据任务的需要,从仓库(存储在ROM中)快速找到相关的工具和材料(多模态嵌入)。这个系统会先根据任务类型(场景级)快速筛选出合适的车间,再在车间内部根据具体任务(原语级)找到最适合的工具。为了节省时间和空间,系统只在需要时才调取相关工具,避免每次都加载全部信息。这样,工厂既能高效运转,又能节省资源。这个比喻说明了LookME如何通过层级检索和稀疏注入,提升多模态模型的效率和效果。

简单解释 像给14岁少年讲一样

想象你在学校里,有很多不同的教室(场景),每个教室里有许多不同的老师(原语),他们负责讲不同的课程。你的任务是找到最适合你问题的老师和课程。以前,老师们都把所有课程资料都放在一个大书架上(存储在模型里),每次找资料都得翻很久,既慢又麻烦。现在,有个聪明的系统可以先根据你的问题类别(比如数学、科学)快速筛选出对应的教室(场景级),然后再在教室里找最合适的老师和课程(原语级)。这个系统只在需要时才去书架拿资料(按需加载),不用每次都翻遍所有书。这样,你就能更快找到答案,学习也更轻松。这就是LookME的工作原理:用层级筛选和智能选择,让复杂的信息变得简单高效。

原文摘要

Vision-Language Models (VLMs) have achieved strong progress in multimodal understanding. However, scaling dense or sparse Mixture-of-Experts (MoE) models to improve performance limits deployment in resource-constrained environments due to the trade-off between high memory usage from full loading and increased latency from on-demand loading. Recently, the Per-Layer Embedding (PLE) architecture addresses this by scaling models with large external embedding tables stored in read-only memory (ROM) and performing lightweight lookup to retrieve relevant embeddings to enhance token representations. Nevertheless, existing PLE-style methods are primarily designed for text embeddings due to the convenience of ID-based retrieval, limiting their effectiveness in VLMs where multimodal embeddings contain richer information for visual tasks. In this paper, we propose LookME, the first framework that enables lookup-based enhancement for multimodal embeddings in VLMs while supporting partitioned storage and on-demand loading. To efficiently lookup arbitrary continuous multimodal embeddings from large-scale embedding tables, we propose a hierarchical two-level lookup method employing a coarse-to-fine strategy that performs lookups from the scene-level to the intra-scene primitive-level. Furthermore, we integrate the lookup method with a sparse injection strategy, which adaptively prioritizes critical embeddings over voluminous multimodal embeddings within layers, and facilitates embedding table reuse across neighboring layers, improving the trade-off among efficiency, model size, and performance. Experiments on multiple visual benchmarks show that LookME outperforms text-only PLE-style methods, validating the effectiveness of lookup-based multimodal embedding enhancement.

cs.CV cs.AI