核心发现
方法论
本文提出的IoU-PD结合了监督微调与特权蒸馏,利用真实边界框作为训练时的额外指导。训练中,学生模型接受原始图像与描述,教师模型则在图像上标记边界框并加入增强提示,条件于特权信息。通过引入IoU感知的令牌加权策略,优化了坐标生成的蒸馏过程,确保模型在推理时无需边界框或额外模块。该方法在RefCOCO、RefCOCO+等基准上实现了显著的区域级提升。
关键结果
- 在标准视觉定位数据集上,IoU-PD在mIoU指标上超越了强基线,提升约4.25个百分点(如在RefCOCO上从81.74提升至85.78),同时在[email protected]和[email protected]指标上也表现优异。 Ablation研究显示,结合监督微调、边界框特权输入与IoU感知加权的全模型效果最优。该方法在不同模型规模和数据规模下均表现出稳定提升,验证了其泛化能力。
- 与传统仅依赖坐标标签的训练方式相比,IoU-PD充分利用了真实边界框的视觉信息,不仅改善了模型的区域定位精度,也增强了模型对复杂场景和小目标的适应性。实验证明,该策略在多项指标上均优于现有先进方法,尤其在高IoU阈值下的性能提升更为显著。
- 通过详细的消融分析,本文验证了引入Privileged Teacher、IoU感知令牌加权策略对性能的贡献,强调了结构化监督与知识蒸馏的结合优势。整体而言,IoU-PD在保持推理简洁性的同时,显著提升了视觉定位的准确性,为多模态大模型的训练提供了新思路。
研究意义
该研究突破了多模态大模型在视觉定位中的训练瓶颈,将真实边界框作为训练中的特权信息,有效缓解了训练目标与评估指标之间的差异。这不仅提升了模型在标准基准上的表现,也为未来的视觉理解任务提供了新的训练范式。通过引入IoU感知机制,模型能更好地理解空间关系,推动多模态模型向更高精度、更强泛化能力发展。这一技术创新对自动驾驶、机器人导航和智能监控等应用具有重要意义,有望引领行业标准的升级。
技术贡献
本文提出的IoU-PD方法在多模态大模型训练中引入了基于真实边界框的Privileged Distillation,结合IoU感知的令牌加权策略,有效对齐坐标生成的训练目标与区域定位的评估指标。其核心创新在于利用边界框作为训练时的视觉引导,增强模型的空间理解能力,同时保持推理时的输入格式不变。这一设计突破了传统只依赖坐标标签的局限,为模型提供了更丰富的监督信息,显著提升了定位性能。该方法在多个公开数据集上实现了优异的性能,验证了其在实际应用中的潜力。
新颖性
本研究首次将真实边界框作为多模态大模型训练中的Privileged Guidance,结合IoU感知的令牌加权机制,有效缓解了训练目标与评估指标的差异。与现有仅依赖坐标字符串的生成式方法不同,IoU-PD利用边界框的视觉信息作为训练辅助,提升区域定位的准确性。这一创新突破了传统坐标生成的局限,为多模态视觉理解提供了全新的训练范式,具有较强的创新性和实用价值。
局限性
- 该方法依赖于高质量的边界框标注,若数据集中的边界框存在误差或不一致,可能影响模型性能。
- 在极端复杂场景或遮挡严重的情况下,Privileged Teacher的视觉引导效果可能受限,导致提升有限。
- 训练过程引入额外的边界框标注和增强步骤,增加了数据预处理的复杂性和计算成本。
未来方向
未来将探索自监督或弱监督的边界框生成策略,以降低对高质量标注的依赖。同时,结合更先进的空间关系建模技术,提升模型对复杂场景和动态目标的适应能力。此外,计划将该方法扩展到视频理解和三维场景中的视觉定位任务,推动多模态模型在更广泛应用中的性能提升。
AI 总览摘要
视觉定位是多模态理解中的核心任务,旨在让模型准确识别图像中描述的目标区域。传统方法多依赖坐标标签进行监督,但在训练目标与评估指标(如IoU)之间存在差异,限制了模型性能提升。为解决这一问题,本文提出了IoU-PD方法,将真实边界框作为训练中的Privileged Guidance,结合IoU感知的令牌加权机制,优化坐标生成的蒸馏过程。
该方法在训练阶段,学生模型接受原始图像和描述,教师模型在图像上标记边界框并加入增强提示,条件于特权信息。通过引入边界框作为视觉引导,模型能更好理解空间关系。实验在RefCOCO、RefCOCO+等数据集上显示,IoU-PD显著优于传统基线,提升了多项指标,尤其在高IoU阈值下表现更佳。
这一创新不仅增强了多模态模型的区域定位能力,也为未来视觉理解任务提供了新的训练范式。其核心在于利用真实边界框作为训练中的辅助信息,突破了只依赖坐标标签的局限,推动模型在复杂场景中的应用潜力。尽管存在对高质量标注的依赖,但整体效果验证了该方法的实用性和前瞻性,为自动驾驶、机器人导航等行业带来新的技术可能。
深度分析
研究背景
多模态视觉定位经历了从基于检测器的回归方法(如DETR、Grounding DINO)到生成式模型的演变。早期方法依赖专门的定位头,性能强但缺乏灵活性。近年来,基于大模型的生成式方法(如Qwen-VL、Liu等)将定位融入自然语言处理框架,简化了系统架构,但训练目标与评估指标存在差异。现有研究多依赖坐标标签,难以充分利用边界框的空间信息。
核心问题
核心难题在于训练目标(坐标字符串)与评估指标(IoU)之间的不匹配。模型在训练中优化字符级似然,导致其在空间关系理解上不足,特别是在复杂场景或小目标中表现不佳。如何利用真实边界框作为训练辅助信息,同时保持推理输入不变,是当前的技术瓶颈。
核心创新
提出Privileged Distillation结合IoU感知令牌加权,创新点在于:• 利用边界框作为训练时的视觉引导,增强空间理解能力;• 设计IoU感知的令牌加权策略,动态调整蒸馏损失,强化关键坐标的学习;• 保持推理输入格式不变,确保模型部署简便。这些创新突破了传统仅依赖字符级监督的局限,显著提升定位性能。
方法详解
- �� 训练阶段,学生模型接受原始图像与描述,教师模型在图像上标记边界框并加入增强提示,条件于特权信息;• 通过结合监督微调(SFT)和Privileged Distillation,优化模型输出;• 设计IoU感知的令牌加权机制,根据预测边界框与真实边界的IoU、坐标误差、数字位置等因素调整蒸馏损失;• 训练过程中,边界框作为视觉引导,提升模型空间关系理解;• 推理阶段,模型仅接受标准输入,无需边界框或额外模块。
实验设计
在RefCOCO、RefCOCO+、RefCOCOg数据集上,采用300k训练样本,比较不同模型架构和训练策略。指标包括mIoU、[email protected]、[email protected]。通过消融实验验证引入监督微调、Privileged Teacher、IoU感知加权的效果。模型在不同规模和数据量下均表现优异,验证了方法的稳定性和泛化能力。
结果分析
在RefCOCO上,IoU-PD提升mIoU从81.74到85.78,[email protected]从88.58到91.56,表现优于所有对比模型。消融分析显示,结合边界框特权输入和IoU感知加权带来最大提升,整体性能稳步提升,尤其在高IoU阈值下效果显著。模型在小目标和复杂场景中表现优异,验证了空间关系理解的增强。
应用场景
该方法适用于自动驾驶中的目标检测、机器人导航、智能监控等场景,能显著提升空间定位精度。只需标准图像和描述,无需额外标注或模块,便于部署。未来可结合视频和三维场景,拓展多模态空间理解能力。
局限与展望
依赖高质量边界框,若数据集标注不准,可能影响性能。复杂场景下Privileged Teacher的引导效果有限,训练成本增加。未来需探索弱监督和自监督策略,降低对标注的依赖。
通俗解读 非专业人士也能看懂
想象你在厨房做饭,菜单上写着“做一道美味的炒饭”。传统方法就像只看菜单上的文字,按照字面意思去做,但有时候菜单描述不够详细,做出来的饭可能不够好吃。现在,厨师还会看一张示意图,图上用绿色圈出主要的食材和步骤,帮助厨师更准确地理解。这个示意图就像论文中的边界框,提供了额外的视觉信息,让厨师做饭更准、更快。训练时,厨师会用这张图和提示来学习,但在正式做饭时,只用菜单文字就可以了。这就像模型在推理时不用边界框,只用描述。这样的方法让厨师学得更好,做出来的炒饭也更美味。这个过程就像论文中的Privileged Guidance,利用额外信息帮助学习,但实际操作时不用这些信息。通过这种方式,厨师变得更聪明,能做出更符合菜单要求的饭菜。这就像模型变得更精准,能更好地找到图像中的目标区域。
原文摘要
Visual grounding with multimodal large language models is commonly formulated as autoregressive coordinate generation, where a model outputs bounding-box coordinates as text given an image and a referring-expression prompt. While this interface is simple and compatible with instruction following, it introduces a mismatch between training and evaluation: training optimizes token-level likelihood over coordinate strings, whereas grounding quality is measured by geometric overlap. We propose IoU-PD, an IoU-aware privileged distillation method for coordinate-generating multimodal large language models. IoU-PD uses ground-truth boxes not only as coordinate targets, but also as privileged training-time guidance. During training, the student receives the original image and prompt, while a frozen teacher receives a box-marked image and an augmented prompt that indicates the marked region. The student is trained with a supervised fine-tuning anchor and a privileged distillation loss whose token weights reflect both geometric importance and teacher reliability. At inference time, IoU-PD requires no box overlay, privileged hint, teacher branch, or additional prediction module. Experiments on standard referring-expression grounding benchmarks show consistent region-level improvements over strong coordinate-generating baselines, demonstrating that ground-truth boxes can provide useful privileged guidance beyond serving as coordinate labels. Project page: https://xyzzzh.github.io/IoU-PD/