Simple Supervision Is Hard to Beat: A Bitter Lesson from Sparse Target Labels in Domain-Adaptive Object Detection

TL;DR

RTSM方法在稀疏标签的域适应目标检测中提升1.7到18.3 AP50。

cs.CV 🟡 进阶级 2026-06-30 4 次浏览
Lijun Zhang Ruinian Xu Mudit Agrawal
域适应 目标检测 稀疏标签 RTSM 自监督学习

核心发现

方法论

本文提出了Random-Target Supervised Mixing (RTSM)方法,通过在稀疏标注的目标图像上加入监督检测损失,增强域适应目标检测的性能。RTSM保持原有无标签适应分支不变,提供了一种简单但有效的锚点。

关键结果

  • RTSM在四种SFDA-OD方法上提升了1.7到18.3 AP50。例如,在DDT方法中,加入5%随机标注数据使AP50从53.669提升到58.695。
  • 在不同目标标签预算下,RTSM均表现出一致的改进。
  • 通过十种反馈插件的评估,发现其增益有限且依赖于具体方法。

研究意义

研究揭示了在稀疏标签的SFDA-OD中,简单监督难以超越。RTSM为稀疏标签SFDA-OD提供了一个简单但有效的锚点,强调直接监督的重要性。

技术贡献

RTSM通过直接监督稀疏目标标签,显著提升了域适应目标检测的性能,提供了一种简单但强大的基线。与现有方法相比,RTSM无需复杂的标签反馈机制。

新颖性

RTSM首次在稀疏标签的SFDA-OD中展示了直接监督的强大效果,与复杂的标签反馈机制相比,表现出更稳定的性能提升。

局限性

  • RTSM未能充分利用稀疏标签来改善无标签自训练分支。
  • 标签反馈插件的增益有限且依赖于具体方法。

未来方向

未来研究可探索如何更有效地利用稀疏标签来改善无标签自训练分支,或开发新的标签反馈机制。

AI 总览摘要

在域适应目标检测中,现有方法通常依赖于教师-学生自训练框架,通过伪标签适应无标注目标域。然而,这种方法在标签稀疏的情况下表现有限。本文提出了Random-Target Supervised Mixing (RTSM),通过在稀疏标注的目标图像上加入监督检测损失,增强了域适应目标检测的性能。RTSM在四种SFDA-OD方法上表现出一致的性能提升,揭示了简单监督在稀疏标签情况下的强大效果。尽管尝试了多种标签反馈插件,但其增益有限且依赖于具体方法,强调了直接监督的重要性。未来研究可探索如何更有效地利用稀疏标签来改善无标签自训练分支,或开发新的标签反馈机制。

深度分析

研究背景

域适应目标检测旨在解决目标检测器在不同视觉统计环境下的性能下降问题。现有方法通常依赖于教师-学生自训练框架,通过伪标签适应无标注目标域。然而,这种方法在标签稀疏的情况下表现有限。

核心问题

在稀疏标签情况下,现有的伪标签依赖方法可能会产生错误的标签,错过困难目标对象,并提供不稳定的优化信号。如何有效利用稀疏标签来改善域适应目标检测是一个重要且困难的问题。

核心创新

RTSM通过在稀疏标注的目标图像上加入监督检测损失,增强了域适应目标检测的性能。与复杂的标签反馈机制相比,RTSM提供了一种简单但强大的基线。

方法详解

  • �� RTSM通过直接监督稀疏目标标签,显著提升了域适应目标检测的性能。• 保持原有无标签适应分支不变,提供了一种简单但有效的锚点。• 评估了十种标签反馈插件,发现其增益有限且依赖于具体方法。

实验设计

实验在Cityscapes、Foggy Cityscapes和BDD100K数据集上进行,评估了四种SFDA-OD方法和两种目标检测器。RTSM在不同目标标签预算下表现出一致的性能提升。

结果分析

RTSM在四种SFDA-OD方法上提升了1.7到18.3 AP50。例如,在DDT方法中,加入5%随机标注数据使AP50从53.669提升到58.695。

应用场景

RTSM可用于自动驾驶和监控场景中的域适应目标检测,提供了一种简单但有效的解决方案。

局限与展望

RTSM未能充分利用稀疏标签来改善无标签自训练分支。标签反馈插件的增益有限且依赖于具体方法。

通俗解读 非专业人士也能看懂

想象一个工厂,工人在生产线上工作。RTSM就像给工人提供了一个简单的工具,帮助他们更好地完成工作,而不是复杂的机器。虽然工厂有很多不同的机器,但这个简单的工具却能显著提高生产效率。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,游戏中有很多关卡。RTSM就像给你一个超级道具,让你更容易通过关卡,而不是复杂的攻略。虽然游戏有很多不同的道具,但这个超级道具却能显著提高你的游戏体验。

术语表

RTSM (随机目标监督混合)

一种通过在稀疏标注的目标图像上加入监督检测损失的方法。

用于增强域适应目标检测的性能。

SFDA-OD (源无关域适应目标检测)

一种在无标注目标域上适应源训练检测器的方法。

通过教师-学生自训练框架实现。

伪标签

由教师模型预测的用于监督学生模型的标签。

在无标注目标域上使用。

教师-学生自训练

一种通过教师模型预测伪标签并优化学生模型的方法。

用于域适应目标检测。

AP50

平均精度在IoU阈值为0.5时的度量。

用于评估目标检测器性能。

开放问题 这项研究留下的未解疑问

  • 1 如何更有效地利用稀疏标签来改善无标签自训练分支仍是一个开放问题。
  • 2 标签反馈机制的设计需要进一步研究,以提高其增益。

应用场景

近期应用

自动驾驶

RTSM可用于自动驾驶场景中的域适应目标检测,提供了一种简单但有效的解决方案。

远期愿景

智能监控

RTSM可用于智能监控场景中的域适应目标检测,帮助提高监控系统的准确性和效率。

原文摘要

Source-free domain adaptive object detection adapts a source-trained detector to an unlabeled target domain, typically through teacher-student self-training with pseudo-labels. We revisit this setting when a small, uniformly sampled subset of target images is labeled. We introduce Random-Target Supervised Mixing (RTSM), a simple anchor that incorporates these annotations through a supervised detection loss while leaving the original unlabeled adaptation branch unchanged. Across evaluations spanning four SFDA-OD methods, two object detectors, multiple adaptation tasks, and target-label budgets from 1% to 10%, RTSM consistently improves pure SFDA by 1.7 to 18.3 AP50. We then examine whether the same annotations can provide further gains by steering unlabeled self-training. To this end, we evaluate ten sparse-label feedback plugins covering pseudo-label selection, object completion, and optimization control, which yield limited and method-dependent gains over RTSM. These results reveal a bitter lesson for sparse-label SFDA-OD: simple supervision is hard to beat. RTSM therefore provides a simple yet effective anchor for sparse-label SFDA-OD.

cs.CV