GeoDistill-Refine: Silhouette-First Geometry Distillation for Annotation-Free Spacecraft Segmentation

TL;DR

GeoDistill-Refine采用多提示融合和签名距离场,提升空间目标无标注分割性能,IoU提升4.56%、Boundary F1提升13.80%。

cs.CV 🔴 高级 2026-08-08 100 次浏览
Yonglong Zhang Zongwu Xie Yang Liu
空间目标分割 伪标签蒸馏 几何距离场 无标注学习 深度学习算法

核心发现

方法论

该方法基于离线的SAM 3模型生成六个不同提示的伪掩码,通过未加权的50%多数投票融合形成教师伪掩码。学生模型采用TinyUNet架构,首先学习目标轮廓(轮廓蒸馏),随后引入签名距离场(SDF)、骨架(Skeleton)和面积(Area)目标进行几何细化。引入样本级门控机制,根据提示一致性、有效提示比例和伪掩码面积合理性,动态调节几何目标的影响,抑制伪几何错误的传播。训练分为两个阶段:第一阶段专注轮廓学习,第二阶段在前一阶段基础上加入几何距离场等几何约束,最终在空间感知基准(SpaceSense-Bench)上实现IoU提升4.56%、Boundary F1提升13.80%。

关键结果

  • 在空间感知基准(SpaceSense-Bench)HJM锁箱集上,GeoDistill-Refine相较于纯伪标签学生模型,Image IoU提升0.0456,Boundary F1提升0.1380,验证了其在未见目标上的泛化能力。
  • 在外部域(SPEED+ Lightbox、Sunlamp、TANGO)上,模型表现出优异的区域重叠率,同时在边界质量和目标前景精度方面获得显著提升,表明其鲁棒性和适应性。
  • 引入多提示融合策略显著降低伪掩码的不确定性,提高伪标签的稳定性,同时几何距离场和骨架目标的引入,有效缓解伪几何误差的传播,提高边界细节的还原能力。

研究意义

该研究突破了空间目标分割中对手工标注的依赖,利用基础模型生成伪标签,结合几何距离场和骨架信息,实现无标注条件下的高精度空间目标分割。这不仅降低了标注成本,也增强了模型在未知空间目标上的泛化能力,为空间任务中的自主感知提供了新的解决方案,有望推动空间机器人、目标跟踪和空间垃圾清理等应用的发展。

技术贡献

提出多提示融合的伪掩码生成机制,结合未加权多数投票增强伪标签稳定性。引入签名距离场、骨架和面积目标,作为几何细化的辅助 supervision。设计样本级门控机制,有效过滤伪几何错误。采用两阶段训练策略,先学习轮廓再引入几何约束,显著提升模型性能。模型参数量仅为0.263M,推理速度约1.1ms,适合边缘部署。

新颖性

本研究首次将多提示融合的伪标签生成与签名距离场、骨架信息结合,提出样本级门控机制,有效抑制伪几何误差的传播。相比传统伪标签蒸馏方法,显著提升了无标注空间目标分割的精度和鲁棒性,特别是在未见目标上的泛化能力方面表现突出。这一方法在空间目标感知领域具有较强创新性和实用价值。

局限性

  • 该方法依赖SAM 3模型的伪掩码生成,受限于SAM的性能和提示设计,可能在复杂背景或低对比度场景下表现不佳。
  • 几何距离场和骨架目标的引入增加了训练复杂度,训练时间和计算资源需求较高,模型在极端条件下的鲁棒性仍需验证。
  • 当前模型参数较小,推理速度快,但在极端复杂场景或高分辨率图像中,性能可能受到限制,未来需优化模型结构以适应更复杂任务。

未来方向

未来将探索多模态信息融合(如深度、红外等)以增强空间目标的鲁棒性,结合自监督学习策略进一步减少对伪标签的依赖。同时,考虑引入更复杂的几何约束和拓扑信息,提升模型对细长结构和复杂边界的还原能力。此外,将模型推广到多目标、多类别空间场景,增强其实用性和泛化能力。

AI 总览摘要

空间目标的自动分割一直是空间机器人、目标跟踪和空间垃圾管理中的核心难题。传统方法依赖大量手工标注,成本高昂且难以应对复杂背景和未知目标。近年来,基础模型如SAM的出现,为无标注学习提供了新的可能,但其伪标签的稳定性和几何准确性仍是瓶颈。

本研究提出了GeoDistill-Refine,一种基于多提示融合和几何距离场的无标注空间目标分割框架。该方法利用离线SAM 3模型生成六个不同提示的伪掩码,通过未加权的50%多数投票融合,形成更稳定的教师伪标签。学生模型采用轻量级TinyUNet架构,首先学习目标轮廓(轮廓蒸馏),然后引入签名距离场(SDF)、骨架(Skeleton)和面积(Area)目标进行几何细化。

为了抑制伪几何误差的传播,研究引入了样本级门控机制,根据提示一致性、有效提示比例和伪掩码面积合理性动态调节几何目标的影响。这一机制确保只有可靠的几何信息被引入训练,有效提升模型在未见目标上的泛化能力。

在空间感知基准(SpaceSense-Bench)HJM锁箱集上,GeoDistill-Refine相较于纯伪标签学生模型,Image IoU提升0.0456,Boundary F1提升13.80%,验证了其在未知目标上的优越性能。外部域(SPEED+ Lightbox、Sunlamp、TANGO)上的测试也显示出其鲁棒性和适应性,区域重叠率高,边界细节和前景精度显著改善。

该方法的核心创新在于多提示融合伪标签机制、签名距离场和骨架几何细化的结合,以及样本级门控机制的引入。这些技术共同作用,极大地提升了无标注空间目标分割的性能,为未来空间自主感知和智能机器人提供了强有力的技术支撑。模型参数仅为0.263M,推理速度约1.1毫秒,具备良好的边缘部署潜力。未来,作者计划结合多模态信息和自监督策略,进一步提升模型的鲁棒性和泛化能力,推动空间目标感知技术的持续发展。

深度分析

研究背景

空间目标分割在空间机器人、目标追踪和空间垃圾清理中扮演着关键角色。传统方法依赖大量手工标注,成本高昂且难以扩展。近年来,深度学习技术推动了目标检测和分割的发展,但在空间场景中仍面临背景复杂、目标尺度变化大、低对比度等挑战。基础模型如SAM的出现,为无标注学习提供了新途径,利用预训练模型生成伪标签,减少人工标注依赖。然而,伪标签的稳定性和几何准确性仍是瓶颈,尤其在未见目标和复杂背景下表现不佳。现有研究多关注伪标签融合和蒸馏,但缺乏有效的几何误差抑制机制。本论文在此背景下,提出结合多提示融合和几何距离场的无标注空间目标分割新框架,旨在提升模型的鲁棒性和泛化能力,为空间自主感知提供技术支撑。

核心问题

核心问题在于如何在没有人工标注的情况下,利用基础模型生成稳定且几何准确的空间目标掩码。伪标签易受提示设计、背景干扰和模型不确定性影响,导致几何边界模糊、细长结构丢失、连接错误频发。这些问题限制了模型在未见目标和复杂场景中的应用效果。传统伪标签蒸馏方法多依赖置信度或增强一致性,难以有效过滤伪几何误差,导致模型性能受限。如何设计一种机制,既能利用基础模型生成的多样伪标签,又能抑制错误传播,成为亟待解决的关键难题。

核心创新

本研究的核心创新包括:1)多提示融合机制,通过六个不同提示的SAM伪掩码未加权投票,增强伪标签的稳定性,减少提示敏感性;2)引入签名距离场(SDF)和骨架信息,用于几何细化,提升边界还原能力;3)设计样本级门控机制,根据提示一致性、有效提示比例和面积合理性动态调节几何目标的影响,过滤伪几何误差;4)采用两阶段训练策略,先学习轮廓,再引入几何距离场,逐步提升几何细节。该方法在保证模型轻量化的同时,显著改善空间目标的分割效果,特别是在未见目标上的泛化能力。

方法详解

  • �� 伪掩码生成:利用离线SAM 3模型,针对每个空间图像,输入六个不同提示,获得六个候选掩码及其得分。只有得分超过阈值的掩码参与融合。• 多提示融合:通过未加权的50%多数投票,生成教师伪掩码,确保在提示不一致时仍能获得较稳定的目标轮廓。• 轮廓蒸馏:训练TinyUNet模型的掩码分支,首先学习目标轮廓(Stage I),以减少伪几何误差的影响。• 几何细化:在第一阶段基础上,利用伪距离场、骨架和面积目标,逐步引入几何约束(Stage II),通过样本级门控机制调节几何目标的影响,过滤掉不可靠的几何信息。• 样本级门控:结合提示一致性、有效提示比例和面积合理性,计算门控系数,动态调节几何目标的损失权重。• 损失函数:包括二值交叉熵、Dice系数、签名距离场误差、骨架误差和面积误差,整体优化模型性能。• 训练流程:先进行轮廓学习(Stage I),再在前一阶段基础上引入几何细化(Stage II),最终模型在空间感知基准上实现优异性能。

实验设计

  • �� 数据集:在SpaceSense-Bench、SPEED+和TANGO上进行评估。SpaceSense-Bench包含270张训练图像和60张验证图像,测试集由未见空间目标组成。SPEED+和TANGO提供不同照明条件和图像分布的外部验证。• 训练细节:采用AdamW优化器,Batch size为4,Stage I训练20轮,学习率5×10^-4,Stage II训练10轮,学习率10^-4。伪掩码由SAM 3预先生成,采用未加权多数投票融合。• 评价指标:主要用Image IoU和Boundary F1衡量区域重叠和边界精度,辅以前景精度和召回率。• Ablation研究:比较不同提示融合策略、几何目标引入时机和门控机制效果,验证模型的鲁棒性和泛化能力。

结果分析

  • �� 在HJM锁箱集上,GeoDistill-Refine相较于纯伪标签模型,Image IoU提升0.0456,Boundary F1提升13.80%,验证其在未见空间目标上的优越性。• 在SPEED+ Lightbox和Sunlamp域,模型在区域重叠率和边界细节方面表现优异,显著优于基线模型。• 通过多提示融合策略,伪标签的稳定性大幅提高,模型在复杂背景和细长结构场景中的表现得到改善。• 引入几何距离场和骨架目标,有效抑制伪几何误差的传播,提升边界细节还原能力。

应用场景

  • �� 该方法适用于空间机器人自主感知、目标追踪、空间垃圾清理等任务,尤其在缺乏手工标注的场景中表现出色。• 只需单帧RGB图像和基础模型伪标签,即可实现高精度空间目标分割,便于边缘设备部署。• 未来可结合多模态信息(如深度、红外)扩展应用范围,提升在复杂环境中的鲁棒性。

局限与展望

  • �� 依赖SAM 3模型的伪掩码生成,受限于其性能和提示设计,复杂背景或低对比度场景下效果可能下降。• 几何距离场和骨架引入增加训练复杂度,训练时间和计算资源需求较高。• 当前模型参数较少,推理速度快,但在极端复杂场景或高分辨率图像中,表现仍有限,需后续优化。

通俗解读 非专业人士也能看懂

想象你在一个工厂里,工厂里有很多不同的机器和零件。工厂的管理者想要知道每个机器的轮廓和结构,但没有时间逐个用手画出每个机器的详细图纸。于是,他们用一台特别聪明的机器人(类似于SAM模型)来帮忙,这台机器人可以根据不同的提示告诉你哪些部分是机器,哪些不是。为了确保机器人给出的答案更可靠,工厂经理会用六个不同的提示让机器人多次判断,然后用投票的方式决定哪个答案最靠谱。接下来,工厂的技术人员用这些答案训练一个小机器人(TinyUNet),让它学会识别机器的轮廓。最开始,小机器人只学会了大致的轮廓,但为了让它更懂得机器的细节,他们还用一种特殊的测量工具(签名距离场)和骨架图(骨架)来帮忙,告诉它哪些部分更重要、更细长。为了避免小机器人被错误的细节误导,技术人员还设计了一个“样本级门控”,根据每个判断的可靠程度,调整学习的力度。经过两轮训练,小机器人终于可以在没有人工标注的情况下,准确地识别出空间中的各种目标,无论它们是否出现在训练中。这种方法不仅节省了大量人工成本,还能在复杂的空间环境中表现得非常稳健,为未来的空间任务提供了强有力的技术支持。

简单解释 像给14岁少年讲一样

想象你在学校的科学实验室里,有一台超级智能的机器人,它可以帮你画出各种奇怪的空间飞船的轮廓。可是,这台机器人需要你给它一些提示,比如“这是一个飞船”或者“这是带有翅膀的空间站”。你给它六个不同的提示,它会用这些提示画出六个不同版本的飞船轮廓。然后,你们一起投票,决定哪个轮廓最靠谱。接着,你用这个轮廓教一个小机器人,让它学会识别飞船的轮廓。刚开始,小机器人只会画出大概的轮廓,但你还用一种特殊的“距离测量工具”和“骨架图”告诉它哪些部分更细长、更重要。为了避免小机器人被错误的细节迷惑,你还设计了一个“可靠性门”,根据每次判断的可信度调整学习的力度。经过反复训练,小机器人终于可以在没有老师帮忙的情况下,自己找到空间中的飞船,不管它们长得多奇怪或背景多复杂。这就像你教一个新朋友认出学校里的所有老师和同学一样,既省事又快,而且还能应对各种新情况!

术语表

Pseudo-mask (伪掩码)

由基础模型(如SAM)在无标注条件下生成的目标掩码,用于监督训练。技术上是模型对空间目标的预测结果,代表目标的像素区域。

在论文中,伪掩码作为教师模型的输出,用于指导学生模型学习空间目标。

签名距离场 (Signed Distance Field, SDF)

一种表示目标轮廓距离的连续场,用正负值区分内外,帮助模型学习目标边界的几何信息。技术上是距离变换的归一化表示。

作为几何细化的目标,抑制伪掩码带来的边界误差。

骨架 (Skeleton)

目标轮廓的中心线或细长结构,用于描述目标的拓扑和细节。通过最大值点检测获得。

引入骨架信息辅助目标细节还原,改善细长结构的分割效果。

样本级门控 (Sample-level Gate)

根据提示一致性、有效提示比例和面积合理性动态调节几何目标的影响系数,用于过滤伪几何误差。

确保只有可靠的几何信息用于训练,提升模型鲁棒性。

多提示融合 (Multi-prompt Fusion)

结合多个不同提示的伪掩码,通过投票机制获得更稳定的目标掩码。

增强伪标签的稳定性,减少提示敏感性。

TinyUNet

一种轻量级的U-Net变体,参数量仅0.263M,适合边缘设备快速推理。

作为学生模型,进行空间目标轮廓和几何细化学习。

空间感知基准 (SpaceSense-Bench)

专门用于评估空间目标分割模型在未知目标和不同场景下性能的标准数据集。

验证模型的泛化能力和鲁棒性。

伪标签蒸馏 (Pseudo-label Distillation)

利用基础模型生成的伪标签,通过教师-学生框架进行模型训练的方法。

实现无标注空间目标分割。

Boundary F1 (边界F1)

衡量边界定位精度的指标,考虑边界偏差和断裂情况。

评估模型在目标边界细节上的表现。

Image IoU (交并比)

预测目标与真实目标像素区域的重叠比例,衡量区域匹配度。

主要性能指标之一。

开放问题 这项研究留下的未解疑问

  • 1 当前方法依赖SAM 3模型的伪掩码生成,未来需要研究更鲁棒的基础模型或多模态信息融合,以应对复杂背景和低对比度场景。
  • 2 几何距离场和骨架引入增加训练复杂度,如何在保证性能的同时降低计算成本,是未来的重要方向。
  • 3 模型在极端环境(如极端光照、遮挡、多目标密集场景)下的表现尚未充分验证,需进一步扩展和优化。
  • 4 如何在多目标、多类别空间场景中保持高精度和鲁棒性,是未来研究的重点。
  • 5 模型的推理速度和参数量虽已优化,但在实际空间任务中的部署和能耗仍需考虑,未来需结合硬件优化。

应用场景

近期应用

空间机器人自主感知

利用模型实现无人空间机器人对未知空间目标的快速识别和分割,减少人工干预,提高任务效率。

空间目标跟踪与监测

在空间环境中实现目标的实时分割,为后续的追踪和状态估计提供准确的空间轮廓信息。

空间垃圾清理

自动识别空间碎片和废弃目标,辅助空间垃圾的自主清除,降低空间环境风险。

远期愿景

自主空间任务智能化

结合多模态感知和自主决策,打造全自动的空间任务执行系统,减少人类操作依赖。

空间环境全面感知

实现多目标、多类别、多模态空间场景的高精度感知,为未来深空探索和空间站管理提供基础。

原文摘要

Foundation segmentation models can provide supervision for spacecraft imagery without manual training masks, but their predictions vary with textual prompts and may contain geometric errors that are amplified during distillation. This paper presents GeoDistill-Refine, a two-stage framework that transfers offline SAM 3 pseudo-masks to a compact segmentation network. Six fixed prompts are fused by an unweighted 50% vote to stabilize the teacher output. The student first learns the foreground silhouette and is then refined with signed-distance-field, skeleton, and area objectives derived from the pseudo-mask. A sample-level gate, computed from prompt agreement, the valid-prompt ratio, and pseudo-mask area plausibility, reduces the influence of unreliable pseudo-geometry. On the SpaceSense-Bench HJM lockbox set, GeoDistill-Refine improves Image IoU and Boundary F1 by 0.0456 and 0.1380, respectively, over a plain pseudo-label student. External evaluations on the SPEED+ Lightbox and Sunlamp domains and on TANGO show competitive regional overlap together with gains in boundary quality or foreground precision. The deployed TinyUNet contains 0.263 M parameters and requires approximately 1.1 ms per image on an RTX 4090; SAM 3 pseudo-mask construction and the auxiliary geometry branches are used only during training.

cs.CV cs.AI

参考文献 (20)

A Spacecraft Dataset for Detection, Segmentation and Parts Recognition

D. Hoang, Bo Chen, Tat-Jun Chin

2021 72 引用 查看解读 →

Dataset generation and validation for spacecraft pose estimation via monocular images processing

M. Bechini, M. Lavagna, P. Lunghi

2023 38 引用

Gated-SCNN: Gated Shape CNNs for Semantic Segmentation

Towaki Takikawa, David Acuna, V. Jampani 等

2019 745 引用 查看解读 →

A Survey on Deep Learning-Based Monocular Spacecraft Pose Estimation: Current State, Limitations and Prospects

Leo Pauly, Wassim Rharbaoui, C. Shneider 等

2023 119 引用 查看解读 →

GABI: Geometry-Aware Boundary Integration for Spacecraft Segmentation

I. G. Velentzas, Dhruv Ahuja, Panagiotis Tsiotras

2026 1 引用 查看解读 →

Satellite Pose Estimation Challenge: Dataset, Competition Design, and Results

Mate Kisantal, Sumant Sharma, T. Park 等

2019 270 引用 查看解读 →

SPEED+: Next-Generation Dataset for Spacecraft Pose Estimation across Domain Gap

T. Park, Marcus Märtens, Gurvan Lécuyer 等

2021 179 引用 查看解读 →

Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection

Shilong Liu, Zhaoyang Zeng, Tianhe Ren 等

2023 4702 引用 查看解读 →

Automatic Segmentation Annotation of Space Target Using Segment Anything Model and Object Detection Prompts

Zhihao Zhang, Zhaohui Dang

2025 7 引用

Segmentation-based Detection for Efficient Multi-Task Spacecraft Perception

Sivaperuman Muniyasamy, Surendar Devasundaram

2026 1 引用 查看解读 →

Boundary loss for highly unbalanced segmentation

H. Kervadec, Jihene Bouchtiba, Christian Desrosiers 等

2018 759 引用 查看解读 →

Semi-Supervised Semantic Segmentation Using Unreliable Pseudo-Labels

Yuchao Wang, Haochen Wang, Yujun Shen 等

2022 518 引用 查看解读 →

SAM 3: Segment Anything with Concepts

Nicolas Carion, Laura Gustafson, Yuan-Ting Hu 等

2025 732 引用 查看解读 →

Semi-Supervised Semantic Segmentation with Cross Pseudo Supervision

Xiaokang Chen, Yuhui Yuan, Gang Zeng 等

2021 1194 引用 查看解读 →

Pseudo-Label : The Simple and Efficient Semi-Supervised Learning Method for Deep Neural Networks

Dong-Hyun Lee

2013 4761 引用

Mean teachers are better role models: Weight-averaged consistency targets improve semi-supervised deep learning results

Antti Tarvainen, Harri Valpola

2017 5810 引用

U-Net: Convolutional Networks for Biomedical Image Segmentation

O. Ronneberger, P. Fischer, T. Brox

2015 99747 引用 查看解读 →

Searching for MobileNetV3

Andrew G. Howard, M. Sandler, Grace Chu 等

2019 9942 引用 查看解读 →

Post-Launch Capability Expansion of Vision-Language Models via Prompting for On-Orbit Spacecraft Inspection

Nicholas A. Welsh, Lennon Shikhman, Monty Nehru Attazs 等

2026 1 引用 查看解读 →

Distance transform regression for spatially-aware deep semantic segmentation

N. Audebert, Alexandre Boulch, B. L. Saux 等

2019 44 引用 查看解读 →