GroundingSuite: Measuring Complex Multi-Granular Pixel Grounding

TL;DR

GroundingSuite通过自动标注和大规模数据集提升像素级多粒度目标定位性能,达成68.9的cIoU。

cs.CV 🔴 高级 2025-03-14 36 次浏览
Rui Hu Lianghui Zhu Yuxuan Zhang Tianheng Cheng Lei Liu Heng Liu Longjin Ran Xiaoxin Chen Wenyu Liu Xinggang Wang
视觉-语言融合 像素定位 自动标注 大规模数据集 多粒度场景

核心发现

方法论

GroundingSuite采用多模态视觉-语言模型(VLM)协作的自动标注框架,包括实体空间定位、语义描述生成和噪声过滤三大模块。首先利用InternVL2.5生成全景描述,再用Florence-2进行空间标注,结合SAM2提取高质量掩码。随后通过定制提示引导大语言模型丰富描述,最后用EVF-SAM过滤噪声,确保数据质量。基于SA-1B大规模图像库,自动生成955万标注对,构建GSTrain-10M数据集。评测采用3,800张图像的GSEval基准,覆盖stuff、part、multi-object和single-object四类场景。模型在此数据上实现68.9的cIoU(gRefCOCO)和55.3的gIoU(RefCOCOm),显著优于现有数据集。

关键结果

  • 模型在gRefCOCO上达到68.9的cIoU,超越之前的最佳方法,显示出大规模自动标注数据的有效性。
  • 在RefCOCOm上实现55.3的gIoU,验证了多粒度、多场景的泛化能力。
  • 自动标注框架比GLaMM快4.5倍,极大提升数据生成效率,为大规模像素定位提供技术支撑。

研究意义

该研究突破了现有像素定位数据集规模和质量的瓶颈,推动视觉-语言模型在复杂场景中的应用。通过自动化标注,大幅降低人工成本,促进多场景、多粒度任务的研究与应用,具有深远的学术和工业价值。尤其在智能机器人、自动驾驶和增强现实等领域,为实现更精细的场景理解提供基础数据和技术方案。

技术贡献

提出基于多模态模型的自动标注框架GSSculpt,结合场景描述、空间定位和噪声过滤,显著提升标注效率和质量。构建955万样本的GSTrain-10M数据集,覆盖丰富的对象类别和场景类型,超越传统手工标注的规模限制。提出多粒度评估基准GSEval,全面衡量模型在stuff、part、multi-object和single-object场景中的性能,为未来多场景、多粒度像素定位提供标准。

新颖性

首次实现基于多模态模型的全自动大规模像素级标注,融合场景描述、空间定位和噪声过滤三大创新模块。提出多粒度、开放类别的评估基准,突破类别限制,提升模型泛化能力。这在自动标注和多场景理解领域具有里程碑意义。

局限性

  • 自动标注依赖预训练模型的准确性,可能在极端复杂场景或遮挡严重时出现误差。
  • 描述丰富度虽提升,但在极端细粒度或背景复杂场景中仍有不足,需进一步优化模型理解能力。
  • 大规模数据处理对计算资源要求高,实际部署仍面临成本挑战。

未来方向

未来将结合更强的多模态模型和自监督学习,提升复杂场景中的标注精度。探索多任务联合训练,增强模型对不同粒度和类别的适应性。同时,推动跨模态知识迁移,拓展到视频和三维场景理解,推动像素级场景理解的全面发展。

AI 总览摘要

像素级目标定位(Pixel Grounding)作为连接视觉与语言的关键技术,近年来引起广泛关注。然而,现有数据集在类别有限、文本多样性不足和标注质量不高方面存在明显瓶颈,限制了模型的泛化和应用。为突破这些限制,本文提出GroundingSuite,结合多模态模型的自动标注框架,显著提升数据规模和质量。

GroundingSuite由三大核心模块组成:实体空间定位、描述生成和噪声过滤。首先,利用InternVL2.5生成全景描述,再用Florence-2进行空间标注,结合SAM2提取高质量掩码。接着,通过设计提示引导大语言模型丰富描述内容,确保表达的唯一性和丰富性。最后,采用EVF-SAM过滤噪声,保证数据的准确性。基于SA-1B图像库,自动生成955万对标注,构建了规模空前的GSTrain-10M数据集。

在此基础上,设计了GSEval评估基准,涵盖stuff、part、multi-object和single-object四类场景,确保模型在复杂多样的任务中得到全面评估。模型在GSEval上实现了68.9的cIoU(gRefCOCO)和55.3的gIoU(RefCOCOm),优于现有方法。自动标注框架比GLaMM快4.5倍,大幅提升数据生成效率。

该研究不仅推动了像素定位技术的规模化和自动化,还为多场景、多粒度的视觉理解提供了坚实基础。未来,将结合更先进的多模态模型,拓展到视频和三维场景理解,推动智能系统的场景感知能力迈向新高度。

深度分析

研究背景

像素定位(Pixel Grounding)作为视觉-语言融合的重要任务,经历了从手工标注到自动化标注的演变。早期工作如RefCOCO系列依赖人工标注,受限于类别和文本多样性。近年来,GLoVe、CLIP、SAM等模型推动了自动标注技术的发展,但仍面临标注质量不足和规模限制的问题。现有数据集如RefCOCOg、RefCOCO+在细粒度和多对象场景中表现有限,难以满足复杂场景理解的需求。自动化标注方法如GLaMM和MRES虽提高效率,但在文本歧义和类别限制方面仍有不足。研究的背景是为了突破数据瓶颈,推动像素定位在多场景、多粒度中的应用,满足工业界对高质量大规模数据的需求。

核心问题

现有像素定位数据集规模有限,类别受限,文本描述多样性不足,难以支持模型的泛化到开放类别和复杂场景。人工标注成本高,自动标注质量不稳定,限制了模型的性能提升。如何在保证标注质量的同时实现大规模自动化,是当前的核心难题。此外,现有评估基准未能全面覆盖多粒度、多场景的复杂需求,限制了模型的实际应用能力。

核心创新

提出多模态模型协作的自动标注框架GSSculpt,结合场景描述、空间定位和噪声过滤,显著提升标注效率和质量。创新点包括:

  • �� 全景描述生成:利用InternVL2.5实现场景全景理解,发现所有关键对象。
  • �� 空间定位:用Florence-2结合SAM2提取高质量掩码,确保空间关系准确。
  • �� 描述丰富:通过提示引导大语言模型,生成平均16词的自然描述,表达丰富且唯一。
  • �� 噪声过滤:用EVF-SAM筛除歧义样本,确保数据可靠性。
  • �� 构建955万样本的GSTrain-10M,涵盖多类别、多场景,推动大规模像素定位研究。

方法详解

  • �� 利用InternVL2.5进行全景场景描述,识别所有重要对象。
  • �� 通过Florence-2模型对描述进行空间标注,获得候选区域。
  • �� 使用SAM2结合空间信息提取像素级掩码。
  • �� 设计提示模板,通过大语言模型丰富描述内容,确保表达的唯一性。
  • �� 采用EVF-SAM过滤歧义样本,筛除不可靠标注。
  • �� 在SA-1B图像库上自动标注955万对,形成规模庞大的训练集。
  • �� 构建GSEval评估基准,涵盖多场景、多粒度,验证模型性能。

实验设计

采用SA-1B作为主要数据源,自动标注955万对,覆盖多类别、多场景。模型训练采用标准的Adam优化器,学习率调节策略,进行多轮训练。评估指标包括gIoU和cIoU,比较不同模型和数据集的性能。通过消融实验验证各模块贡献,分析描述丰富度对性能的影响。测试模型在GSEval上的表现,确保泛化能力,进行跨场景评估。

结果分析

模型在gRefCOCO上达到68.9的cIoU,优于以往手工和自动标注方法,验证大规模自动标注的有效性。RefCOCOm上实现55.3的gIoU,显示出多粒度、多场景的适应能力。自动标注框架比GLaMM快4.5倍,极大提升了数据生成效率。模型在不同场景中的表现均优于基线,验证了数据集的多样性和标注质量的提升。

应用场景

该技术可广泛应用于智能机器人、自动驾驶、增强现实等场景,实现更精准的场景理解和目标定位。自动标注大规模数据降低了行业门槛,加快了模型训练速度,为工业界提供高质量训练数据。未来,结合多模态模型,将推动场景感知、交互式系统和智能监控的发展。

局限与展望

自动标注依赖预训练模型的准确性,在极端复杂或遮挡严重的场景中仍可能出现误差。描述丰富度虽提升,但在极细粒度或背景复杂的场景中仍有不足。大规模数据处理对计算资源要求高,实际部署成本较大。未来需优化模型鲁棒性和计算效率,提升在极端场景中的表现。

通俗解读 非专业人士也能看懂

想象你在厨房做饭。每次准备食材时,你会先找到所有需要的材料(比如蔬菜、肉、调料),然后用不同的工具(刀、锅、勺子)处理它们。为了让别人也能理解你在做什么,你会用详细的描述,比如“切碎的胡萝卜放在碗里”或者“煮熟的鸡肉在盘子上”。这些描述帮助别人知道你在做什么,也能让他们帮你完成任务。现在,研究人员就像厨师一样,用电脑和算法“描述”图片中的物体,让机器也能理解场景,像我们描述厨房一样详细。这项工作通过自动生成大量“菜谱”和“步骤”,让机器更聪明,能在复杂场景中找到目标,就像厨师能在繁忙厨房中快速找到需要的食材一样。

简单解释 像给14岁少年讲一样

想象你在学校的食堂里点餐。你告诉厨师“我要一份炒饭,里面有鸡蛋和青豆”。厨师听懂了,知道你要什么,然后把菜做好。这就像电脑要理解图片里的东西一样。以前,电脑只能认出几种东西,比如“苹果”和“香蕉”。但现在,研究人员让电脑学会用更详细的描述,比如“一个绿色的苹果在桌子上”。他们还教电脑用自动方法找到图片里的每个物体,就像厨师在厨房里找食材一样。这样,电脑可以更聪明地理解复杂的场景,比如多个人、多只动物或背景。这个新技术让电脑能像厨师一样,快速、准确地找到想要的东西,未来可以帮我们做很多事情,比如自动驾驶、智能机器人和虚拟现实。

原文摘要

Pixel grounding, encompassing tasks such as Referring Expression Segmentation (RES), has garnered considerable attention due to its immense potential for bridging the gap between vision and language modalities. However, advancements in this domain are currently constrained by limitations inherent in existing datasets, including limited object categories, insufficient textual diversity, and a scarcity of high-quality annotations. To mitigate these limitations, we introduce GroundingSuite, which comprises: (1) an automated data annotation framework leveraging multiple Vision-Language Model (VLM) agents; (2) a large-scale training dataset encompassing 9.56 million diverse referring expressions and their corresponding segmentations; and (3) a meticulously curated evaluation benchmark consisting of 3,800 images. The GroundingSuite training dataset facilitates substantial performance improvements, enabling models trained on it to achieve state-of-the-art results. Specifically, a cIoU of 68.9 on gRefCOCO and a gIoU of 55.3 on RefCOCOm. Moreover, the GroundingSuite annotation framework demonstrates superior efficiency compared to the current leading data annotation method, i.e., $4.5 \times$ faster than GLaMM.

cs.CV