Kosmos-2: Grounding Multimodal Large Language Models to the World

TL;DR

KOSMOS-2为多模态大语言模型,具备对象定位和文本地面能力,显著提升视觉-语言任务表现。

cs.CL 🔴 高级 2023-06-27 44 次浏览
Zhiliang Peng Wenhui Wang Li Dong Yaru Hao Shaohan Huang Shuming Ma Furu Wei
多模态学习 地面任务 大语言模型 视觉理解 人工通用智能

核心发现

方法论

KOSMOS-2基于Transformer架构,结合Grounded图像-文本对(GRIT)数据集,通过将边界框坐标离散化为位置标记,构建超链接式的输入格式,实现文本与视觉区域的联合理解。模型采用下一词预测任务,融合多模态语料与Grounded数据,训练过程中引入grounding token,增强模型对对象和区域的定位能力。训练使用AdamW优化器,结合instruction tuning优化模型对人类指令的响应能力,参数规模约1.6B。模型在多任务上表现优异,包括指称表达理解、生成、视觉问答与图像描述,显著优于之前的多模态模型。

关键结果

  • 在Flickr30k实体数据集上,KOSMOS-2在R@1指标达到78.7%,超越GRILL(18.9%)等模型,展现出强大的零样本地面能力。
  • 在RefCOCO、RefCOCO+和RefCOCOg数据集上,模型在指称理解任务中达到了60.57%、61.65%的准确率,优于多数零样本方法。
  • 在图像描述和VQA任务中,CIDEr和VQA准确率分别达到60.3和72.4%,显示模型在感知-语言任务中的竞争力。

研究意义

该研究推动了多模态大模型向具备对象定位与理解的方向发展,为实现更具“体现性”的AI系统奠定基础。模型能有效结合视觉区域与自然语言,改善人机交互的自然性与准确性,有望在自动驾驶、机器人和智能辅助等领域引领变革。其grounding能力解决了纯文本模型在视觉理解中的瓶颈,为未来实现类人智能提供关键技术支撑。

技术贡献

提出将连续边界框坐标离散化为位置标记,结合超链接式输入格式,创新性地将空间信息融入Transformer模型中。引入Grounded图像-文本对(GRIT)大规模数据集,显著提升模型的地面能力。模型在保持原有多模态理解能力基础上,增强了对象指称、区域定位与视觉问答的性能,展示了多模态融合的有效路径。

新颖性

首次在大规模多模态模型中系统引入边界框离散化与超链接式输入,实现在单一模型中同时具备文本理解与空间地面能力,突破了以往仅依赖检测器或提案的限制。该方法为多模态模型赋予了更强的空间感知与推理能力,开启了多模态融合的新范式。

局限性

  • 模型在复杂场景中的空间推理仍存在局限,尤其是在遮挡或多目标密集的图像中,边界框预测准确率下降。
  • 训练成本较高,依赖大规模Grounded数据集,数据采集与标注仍是瓶颈。
  • 模型对极端长文本或多区域指称的理解能力有待提升,未来需优化多区域联合理解机制。

未来方向

未来将探索多模态交互增强技术,提升模型在动态场景中的实时反应能力。计划引入更丰富的空间推理机制,增强多目标复杂场景的理解。还将结合强化学习与自监督技术,进一步提升模型的泛化能力和效率,推动AI向更具“体现性”的方向发展。

AI 总览摘要

KOSMOS-2代表了多模态大语言模型的重大突破,融合了视觉理解与空间地面能力,为人工智能迈向更具“体现性”的智能系统提供了新路径。传统多模态模型多依赖检测器或提案机制,难以实现精确的对象定位与理解。本文提出通过将边界框离散化为位置标记,结合超链接式输入格式,有效将空间信息融入Transformer架构中,显著提升模型的空间推理能力。利用大规模Grounded图像-文本对(GRIT)数据集,模型在多个任务中表现优异,包括指称表达理解、生成、视觉问答和图像描述,均超越之前的零样本方法。实验结果显示,在Flickr30k实体数据集上,R@1达78.7%,远超之前模型,验证了其强大的地面能力。在指称理解任务中,模型在RefCOCO系列数据集上达到了60%以上的准确率,表现出良好的泛化能力。该研究不仅推动了多模态模型的技术边界,也为自动驾驶、机器人和智能交互等应用提供了坚实基础。未来,模型将继续优化空间推理与多目标理解,结合强化学习实现更高效的自主学习,推动AI向更“体现性”与“智能化”方向迈进。

深度分析

研究背景

多模态大模型经历了从早期的单模态感知到融合多模态信息的快速发展。代表性工作包括OpenAI的GPT系列、Google的PaLM,以及微软的KOSMOS系列。这些模型在自然语言理解、视觉识别及跨模态任务中取得突破,但大多缺乏空间地面能力,难以实现精确对象定位。近年来,Grounded图像-文本数据集(如RefCOCO、Visual Genome)推动了空间理解的研究,但规模有限,难以支撑大模型训练。随着大规模数据集(如LAION-2B、COYO-700M)出现,结合空间信息的多模态模型成为研究热点。本论文基于此背景,提出了Grounded大模型,旨在突破纯文本理解的瓶颈,赋予模型空间感知与推理能力。

核心问题

现有多模态模型在空间理解方面表现不足,主要因缺乏有效的空间信息编码机制。边界框预测依赖检测器,受限于提案数和精度,难以实现端到端的空间推理。如何将连续空间坐标转化为模型可理解的离散标记,成为关键技术难题。此外,缺乏大规模Grounded数据集限制了模型的泛化能力。解决这些问题,才能实现模型对复杂场景中对象的准确定位与理解,从而推动多模态AI的实用化。

核心创新

本研究提出将连续边界框坐标离散化为位置标记,利用超链接式输入格式,将空间信息融入Transformer模型中。这一创新使模型能端到端学习空间定位,避免依赖单独检测器。构建大规模Grounded图像-文本对(GRIT),结合多源数据,显著提升模型的空间理解能力。模型在多任务上表现优异,兼具文本理解和空间推理能力,突破了以往模型在空间感知上的局限。

方法详解

  • �� 构建Grounded图像-文本对(GRIT)数据集,结合LAION-2B和COYO-700M,利用预训练检测器(如GLIP)提取边界框。• 将连续空间坐标离散化为位置标记,划分图像空间为P×P网格,使用中心像素作为标记。• 设计超链接式输入格式,将文本片段与对应空间位置标记连接,形成“<p>文本</p><box>位置标记</box>”结构。• 在Transformer模型中引入grounding token,训练模型学习文本与空间区域的映射关系。• 采用下一词预测任务,结合多模态语料与Grounded数据,优化模型参数。• 通过instruction tuning,增强模型对人类指令的响应能力,提升多任务性能。

实验设计

模型在Flickr30k实体、RefCOCO系列、VQA和图像描述数据集上进行评估。采用R@1、准确率、CIDEr等指标,比较基线模型如MDETR、GLIP。训练过程中调节超参数,验证不同空间离散化粒度P的效果。设计消融实验验证边界框离散化与超链接输入的贡献。通过大规模Grounded数据集训练,模型在空间定位和指称理解任务中表现优越,验证了方法的有效性。

结果分析

在Flickr30k实体上,R@1达78.7%,优于现有零样本模型。RefCOCO、RefCOCO+和RefCOCOg的指称理解准确率分别达60.57%、61.65%,大幅领先于之前的零样本方法。在图像描述和VQA任务中,CIDEr达60.3,VQA准确率达72.4%。模型在多任务场景中表现出色,验证了空间地面能力的提升。消融实验显示,边界框离散化和超链接格式是性能提升的关键因素。

应用场景

模型可应用于自动驾驶中的目标检测与理解、机器人导航、智能问答系统及增强现实。其空间理解能力使得交互更自然、准确,适合需要精确对象定位的场景。未来可结合强化学习实现自主空间推理,推动智能系统的自主决策能力。

局限与展望

模型在遮挡、多目标密集场景中表现仍有限,空间推理准确率下降。训练成本高,依赖大规模Grounded数据集,数据采集与标注仍是瓶颈。对极端复杂场景的理解能力有待提升,未来需优化多目标联合推理机制。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,所有食材都放在不同的架子上。有的在左边,有的在右边。以前的AI就像只会认出食材的名字,但不知道它们放在哪里。KOSMOS-2就像一个聪明的厨师,不仅知道食材的名字,还能告诉你它们具体放在哪个架子上。它用一种特殊的“地图”把每个食材的位置标记出来,这样你问它“哪个在左边的苹果?”它就能准确告诉你。这个厨师还可以根据你描述的菜肴,找到所有需要的食材,帮你快速准备。它的聪明之处在于,能把空间信息和语言结合起来,让人机交流变得更自然、更高效。

简单解释 像给14岁少年讲一样

想象你在学校的图书馆找书,以前的AI就像只知道书的名字,但不知道它们放在哪个书架上。现在,KOSMOS-2像一个超级聪明的图书管理员,不仅知道书的名字,还能告诉你它们具体在哪个架子上。它用一种特殊的“地图”把每本书的位置标记出来,比如“左边第3排第2本”。当你说“我想找那本红色封面的书”,它能根据你的描述,准确找到那本书放在哪个位置。这样一来,你找书就变得又快又准。它还可以根据你描述的内容,帮你写出详细的书评或回答你关于书的提问。它的厉害之处在于,把空间信息和文字结合在一起,让交流变得更自然、更聪明。

术语表

Grounded图像-文本对 (Grounded image-text pairs)

结合空间信息的图像与文本配对,包含边界框和描述,用于训练模型理解空间关系。

用于构建GRIT数据集,增强模型空间地面能力。

位置标记 (location tokens)

离散化的空间坐标,用于表示边界框在图像中的位置,融入模型输入。

将连续空间坐标转化为模型可理解的离散符号。

超链接式输入格式 (hyperlink input format)

将文本片段与空间位置标记结合,形成类似超链接的结构,增强文本与空间的关联。

实现文本与视觉区域的端到端理解。

指称表达 (referring expressions)

描述特定对象或区域的自然语言短语,用于引导模型定位目标。

模型在指称理解和生成任务中的核心输入。

Grounding能力

模型将自然语言与图像空间区域关联的能力,实现对象定位和理解。

模型的核心创新之一。

开放问题 这项研究留下的未解疑问

  • 1 当前模型在极端复杂场景(如多目标遮挡或密集区域)中的空间推理仍不足,未来需结合更强的空间推理机制和多目标联合理解技术。

应用场景

近期应用

智能机器人导航

利用模型的空间理解能力,实现机器人在复杂环境中的目标识别与路径规划,提升自主导航的准确性和效率。

自动驾驶辅助

通过空间地面能力,增强车辆对周围环境中目标的定位与理解,提升行车安全。

远期愿景

人机自然交互

实现更自然的语音和视觉交互,机器人或虚拟助手能准确理解空间指示,提供个性化服务。

原文摘要

We introduce Kosmos-2, a Multimodal Large Language Model (MLLM), enabling new capabilities of perceiving object descriptions (e.g., bounding boxes) and grounding text to the visual world. Specifically, we represent refer expressions as links in Markdown, i.e., ``[text span](bounding boxes)'', where object descriptions are sequences of location tokens. Together with multimodal corpora, we construct large-scale data of grounded image-text pairs (called GrIT) to train the model. In addition to the existing capabilities of MLLMs (e.g., perceiving general modalities, following instructions, and performing in-context learning), Kosmos-2 integrates the grounding capability into downstream applications. We evaluate Kosmos-2 on a wide range of tasks, including (i) multimodal grounding, such as referring expression comprehension, and phrase grounding, (ii) multimodal referring, such as referring expression generation, (iii) perception-language tasks, and (iv) language understanding and generation. This work lays out the foundation for the development of Embodiment AI and sheds light on the big convergence of language, multimodal perception, action, and world modeling, which is a key step toward artificial general intelligence. Code and pretrained models are available at https://aka.ms/kosmos-2.

cs.CL cs.CV