GroundingSuite: Measuring Complex Multi-Granular Pixel Grounding
GroundingSuite leverages multi-modal models for automatic pixel grounding annotation, achieving 68.9 cIoU on gRefCOCO with 955万样本。
Key Findings
Methodology
GroundingSuite employs a multi-stage framework integrating InternVL2.5 for global scene description, Florence-2 for phrase grounding, SAM2 for mask extraction, and EVF-SAM for noise filtering. The process begins with comprehensive scene understanding, generating detailed descriptions of all salient objects. These descriptions serve as prompts for large language models to produce unambiguous, rich references. Spatial localization is achieved through precise phrase grounding, followed by pixel-level mask extraction. Noise filtering ensures high annotation quality. The entire pipeline is applied to SA-1B images, resulting in 955万高质量像素标注对,构建了规模空前的GSTrain-10M数据集。评估采用GSEval基准,涵盖多场景、多粒度任务,模型在此数据上实现了68.9的cIoU(gRefCOCO)和55.3的gIoU(RefCOCOm),显著优于现有方法。
Key Results
- 模型在gRefCOCO上获得68.9的cIoU,超越之前的最优方法,验证了大规模自动标注的有效性。
- 在RefCOCOm上实现55.3的gIoU,展现出多粒度、多场景的强泛化能力。
- 自动标注框架比GLaMM快4.5倍,大幅提升数据生成效率,为大规模像素定位提供技术基础。
Significance
本研究突破了像素定位数据集的规模与质量瓶颈,推动了视觉-语言模型在复杂场景中的应用。自动化标注极大降低人工成本,促进多场景、多粒度任务的发展,为智能机器人、自动驾驶和增强现实等行业提供了坚实的数据基础。通过高质量大规模数据,模型能更好理解复杂场景中的目标关系,推动智能系统的场景感知能力迈向新高度。
Technical Contribution
提出结合多模态模型的自动标注框架GSSculpt,融合场景描述、空间定位和噪声过滤技术,显著提升标注效率和质量。构建955万样本的GSTrain-10M,覆盖丰富类别和场景类型,突破传统手工标注的规模限制。设计多粒度评估基准GSEval,全面衡量模型在多场景、多粒度任务中的表现,为未来像素定位研究提供标准。
Novelty
首次实现基于多模态模型的全自动大规模像素级标注,融合场景描述、空间定位和噪声过滤三大创新。提出多粒度、开放类别的评估基准,突破类别限制,增强模型泛化能力。这在自动标注和多场景理解领域具有里程碑意义,推动了自动化像素定位技术的快速发展。
Limitations
- 自动标注依赖预训练模型的准确性,在极端复杂或遮挡严重的场景中可能出现误差。
- 描述丰富度虽提升,但在极细粒度或背景复杂场景中仍有不足,需进一步优化模型理解能力。
- 大规模数据处理对计算资源要求高,实际部署成本较大。未来需提升模型鲁棒性和效率。
Future Work
未来将结合更先进的多模态模型和自监督学习,提升复杂场景中的标注精度。探索多任务联合训练,增强模型对不同粒度和类别的适应性。同时,推动跨模态知识迁移,拓展到视频和三维场景理解,推动像素级场景理解的全面发展。
AI Executive Summary
Pixel grounding作为连接视觉与语言的核心任务,近年来取得显著进展,但受限于数据集规模、类别和标注质量,难以满足复杂场景的需求。传统手工标注成本高,自动标注虽提高效率但质量参差。为此,本文提出GroundingSuite,结合多模态模型的自动标注框架,有效解决了规模和质量瓶颈。
该框架由三大模块组成:实体空间定位、描述生成和噪声过滤。首先,利用InternVL2.5生成全景描述,识别所有关键对象;然后,借助Florence-2和SAM2实现空间标注和像素掩码提取;接着,设计提示引导大语言模型丰富描述内容,确保表达唯一性和丰富性;最后,采用EVF-SAM过滤歧义样本,确保数据质量。基于SA-1B图像库,自动生成955万高质量像素标注对,构建了规模空前的GSTrain-10M数据集。
在此基础上,设计了GSEval评估基准,涵盖stuff、part、multi-object和single-object场景,确保模型在多样化任务中的全面评估。模型在GSEval上实现了68.9的cIoU(gRefCOCO)和55.3的gIoU(RefCOCOm),优于现有方法。自动标注框架比GLaMM快4.5倍,大幅提升数据生成效率。
该研究推动了像素定位的自动化和规模化,为多场景、多粒度的视觉理解提供了基础。未来,将结合更强模型,拓展到视频和三维场景,推动智能系统的场景感知能力迈向新高度。
Deep Analysis
Background
像素定位(Pixel Grounding)作为视觉-语言融合的重要任务,经历了从手工标注到自动化标注的演变。早期如RefCOCO系列依赖人工,受限于类别和文本多样性。近年来,GLoVe、CLIP、SAM等模型推动了自动标注技术,但仍存在标注质量不足和规模限制的问题。现有数据集如RefCOCOg、RefCOCO+在细粒度和多对象场景中表现有限,难以满足复杂场景理解的需求。自动化标注方法如GLaMM和MRES虽提高效率,但在文本歧义和类别限制方面仍有不足。研究背景旨在突破数据瓶颈,推动多场景、多粒度像素定位的应用,满足工业界对高质量大规模数据的需求。
Core Problem
现有像素定位数据集规模有限,类别受限,文本描述多样性不足,难以支持模型的泛化到开放类别和复杂场景。人工标注成本高,自动标注质量不稳定,限制了模型性能提升。如何在保证标注质量的同时实现大规模自动化,是当前的核心难题。此外,现有评估基准未能全面覆盖多粒度、多场景的复杂需求,限制了模型的实际应用能力。
Innovation
提出多模态模型协作的自动标注框架GSSculpt,结合场景描述、空间定位和噪声过滤,显著提升标注效率和质量。创新点包括:
- �� 全景描述生成:利用InternVL2.5实现场景全景理解,发现所有关键对象。
- �� 空间定位:用Florence-2结合SAM2提取高质量掩码,确保空间关系准确。
- �� 描述丰富:通过提示引导大语言模型,生成平均16词的自然描述,表达丰富且唯一。
- �� 噪声过滤:用EVF-SAM筛除歧义样本,确保数据可靠性。
- �� 构建955万样本的GSTrain-10M,涵盖多类别、多场景,推动大规模像素定位研究。
Methodology
- �� 利用InternVL2.5进行全景场景描述,识别所有重要对象。
- �� 通过Florence-2模型对描述进行空间标注,获得候选区域。
- �� 使用SAM2结合空间信息提取像素级掩码。
- �� 设计提示模板,通过大语言模型丰富描述内容,确保表达的唯一性。
- �� 采用EVF-SAM过滤歧义样本,筛除不可靠标注。
- �� 在SA-1B图像库上自动标注955万对,形成规模庞大的训练集。
- �� 构建GSEval评估基准,涵盖多场景、多粒度,验证模型性能。
Experiments
采用SA-1B作为主要数据源,自动标注955万对,覆盖多类别、多场景。模型训练采用标准的Adam优化器,学习率调节策略,进行多轮训练。评估指标包括gIoU和cIoU,比较不同模型和数据集的性能。通过消融实验验证各模块贡献,分析描述丰富度对性能的影响。测试模型在GSEval上的表现,确保泛化能力,进行跨场景评估。
Results
模型在gRefCOCO上达到68.9的cIoU,优于以往手工和自动标注方法,验证大规模自动标注的有效性。RefCOCOm上实现55.3的gIoU,显示出多粒度、多场景的适应能力。自动标注框架比GLaMM快4.5倍,极大提升了数据生成效率。模型在不同场景中的表现均优于基线,验证了数据集的多样性和标注质量的提升。
Applications
该技术可广泛应用于智能机器人、自动驾驶、增强现实等场景,实现更精准的场景理解和目标定位。自动标注大规模数据降低了行业门槛,加快了模型训练速度,为工业界提供高质量训练数据。未来,结合多模态模型,将推动场景感知、交互式系统和智能监控的发展。
Limitations & Outlook
自动标注依赖预训练模型的准确性,在极端复杂或遮挡严重的场景中仍可能出现误差。描述丰富度虽提升,但在极细粒度或背景复杂的场景中仍有不足。大规模数据处理对计算资源要求高,实际部署成本较大。未来需优化模型鲁棒性和计算效率,提升在极端场景中的表现。
Plain Language Accessible to non-experts
想象你在厨房做饭。每次准备食材时,你会先找到所有需要的材料(比如蔬菜、肉、调料),然后用不同的工具(刀、锅、勺子)处理它们。为了让别人也能理解你在做什么,你会用详细的描述,比如“切碎的胡萝卜放在碗里”或者“煮熟的鸡肉在盘子上”。这些描述帮助别人知道你在做什么,也能让他们帮你完成任务。现在,研究人员就像厨师一样,用电脑和算法“描述”图片中的物体,让机器也能理解场景,像我们描述厨房一样详细。这项工作通过自动生成大量“菜谱”和“步骤”,让机器更聪明,能在复杂场景中找到目标,就像厨师能在繁忙厨房中快速找到需要的食材一样。
ELI14 Explained like you're 14
想象你在学校的食堂里点餐。你告诉厨师“我要一份炒饭,里面有鸡蛋和青豆”。厨师听懂了,知道你要什么,然后把菜做好。这就像电脑要理解图片里的东西一样。以前,电脑只能认出几种东西,比如“苹果”和“香蕉”。但现在,研究人员让电脑学会用更详细的描述,比如“一个绿色的苹果在桌子上”。他们还教电脑用自动方法找到图片里的每个物体,就像厨师在厨房里找食材一样。这样,电脑可以更聪明地理解复杂的场景,比如多个人、多只动物或背景。这个新技术让电脑能像厨师一样,快速、准确地找到想要的东西,未来可以帮我们做很多事情,比如自动驾驶、智能机器人和虚拟现实。
Abstract
Pixel grounding, encompassing tasks such as Referring Expression Segmentation (RES), has garnered considerable attention due to its immense potential for bridging the gap between vision and language modalities. However, advancements in this domain are currently constrained by limitations inherent in existing datasets, including limited object categories, insufficient textual diversity, and a scarcity of high-quality annotations. To mitigate these limitations, we introduce GroundingSuite, which comprises: (1) an automated data annotation framework leveraging multiple Vision-Language Model (VLM) agents; (2) a large-scale training dataset encompassing 9.56 million diverse referring expressions and their corresponding segmentations; and (3) a meticulously curated evaluation benchmark consisting of 3,800 images. The GroundingSuite training dataset facilitates substantial performance improvements, enabling models trained on it to achieve state-of-the-art results. Specifically, a cIoU of 68.9 on gRefCOCO and a gIoU of 55.3 on RefCOCOm. Moreover, the GroundingSuite annotation framework demonstrates superior efficiency compared to the current leading data annotation method, i.e., $4.5 \times$ faster than GLaMM.