iSAGE: A Human-in-the-Loop Framework for Remote Sensing Semantic Segmentation via Sparse Point Supervision

TL;DR

iSAGE框架通过稀疏点监督实现遥感语义分割,恢复97.2%的密集监督性能。

cs.CV 🔴 高级 2026-06-09 9 次浏览
Osmar Luiz Ferreira de Carvalho Osmar Abilio de Carvalho Junior Anesmar Olino de Albuquerque Daniel Guerreiro e Silva
遥感 语义分割 人机交互 稀疏监督 机器学习

核心发现

方法论

iSAGE框架通过专家点击识别模型的自信错误像素,采用错误加权损失函数放大这些像素的梯度,从而实现稀疏点监督的语义分割。该框架不依赖任何辅助机器生成标签,直接利用人类专家的点击进行模型训练。

关键结果

  • 在BsB Aerial数据集上,iSAGE以0.040%的像素恢复了74.79%的mIoU,达到了97.2%的密集监督性能。
  • 在ISPRS Vaihingen基准上,iSAGE以0.011%的像素达到了76.78%的mIoU,超过所有已发表的方法。
  • 四种输出读取机制在相同管道下表现均低于iSAGE 7.4到14.5个百分点。

研究意义

iSAGE框架在遥感语义分割领域具有重要意义。它显著降低了标注成本,同时保持了高精度,解决了传统方法在传感器、平台和地理位置间迁移困难的问题。该框架为学术界和工业界提供了一种高效且可扩展的解决方案。

技术贡献

iSAGE的技术贡献在于其无需辅助机器生成标签,直接利用专家点击进行训练。这种方法在31种人机交互框架中独树一帜,提供了新的理论保证和工程可能性。

新颖性

iSAGE是首个完全依赖专家点击而不使用标签扩展机制的人机交互框架,与现有方法相比,其创新在于直接利用模型的自信错误进行训练。

局限性

  • iSAGE在处理复杂边界时可能存在局限,因为它依赖于专家的视觉判断。
  • 该方法在大规模数据集上的性能尚未验证。

未来方向

未来工作可以探索在更大规模数据集上的应用,以及结合其他主动学习策略以进一步提高效率。

AI 总览摘要

遥感语义分割需要高昂的像素级标注成本,现有方法难以在不同传感器、平台和地理位置间迁移。iSAGE框架通过专家点击识别模型的自信错误像素,采用错误加权损失函数放大这些像素的梯度,从而实现稀疏点监督的语义分割。

在实验中,iSAGE在BsB Aerial数据集上以0.040%的像素恢复了74.79%的mIoU,达到了97.2%的密集监督性能。在ISPRS Vaihingen基准上,iSAGE以0.011%的像素达到了76.78%的mIoU,超过所有已发表的方法。

iSAGE框架的创新在于无需辅助机器生成标签,直接利用专家点击进行训练。这种方法在31种人机交互框架中独树一帜,提供了新的理论保证和工程可能性。未来工作可以探索在更大规模数据集上的应用,以及结合其他主动学习策略以进一步提高效率。

深度分析

研究背景

遥感语义分割领域的研究一直面临高昂的标注成本和模型迁移困难的问题。传统方法依赖于密集的像素级标注,难以在不同传感器、平台和地理位置间迁移。近年来,稀疏监督和人机交互方法逐渐受到关注,但大多依赖于辅助机器生成标签。

核心问题

遥感语义分割需要高昂的像素级标注成本,现有方法难以在不同传感器、平台和地理位置间迁移。如何在降低标注成本的同时保持高精度,是该领域亟待解决的问题。

核心创新

iSAGE框架通过专家点击识别模型的自信错误像素,采用错误加权损失函数放大这些像素的梯度,从而实现稀疏点监督的语义分割。与现有方法相比,iSAGE不依赖于任何辅助机器生成标签,直接利用人类专家的点击进行模型训练。

方法详解

  • �� 专家点击识别模型的自信错误像素
  • �� 使用错误加权损失函数放大这些像素的梯度
  • �� 不依赖于任何辅助机器生成标签
  • �� 直接利用人类专家的点击进行模型训练

实验设计

实验在BsB Aerial和ISPRS Vaihingen数据集上进行,采用U-Net架构。通过对比四种输出读取机制,验证了iSAGE的优越性。

结果分析

iSAGE在BsB Aerial数据集上以0.040%的像素恢复了74.79%的mIoU,达到了97.2%的密集监督性能。在ISPRS Vaihingen基准上,iSAGE以0.011%的像素达到了76.78%的mIoU,超过所有已发表的方法。

应用场景

iSAGE框架可用于遥感图像的高效语义分割,特别适用于标注成本高昂的场景,如城市规划、环境监测等。

局限与展望

iSAGE在处理复杂边界时可能存在局限,因为它依赖于专家的视觉判断。该方法在大规模数据集上的性能尚未验证。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。传统方法就像要你给每个食材都贴上标签,费时费力。而iSAGE就像是你只需标记那些你知道有问题的食材,比如坏掉的土豆,然后根据这些信息调整你的菜谱。这样,你不用花太多时间在每个食材上,但仍能做出美味的菜肴。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你要找出地图上所有隐藏的宝藏。传统方法就像是你要挖遍每一寸土地,太累了!而iSAGE就像是你只需要标记那些你知道有宝藏的地方,然后根据这些信息来调整你的搜索策略。这样,你不用花太多时间在每个地方,但仍能找到所有的宝藏!

术语表

稀疏监督 (Sparse Supervision)

通过少量标注点进行模型训练,而不是依赖于密集的像素级标注。

iSAGE利用稀疏监督来降低标注成本。

错误加权损失 (Error-Weighted Loss)

一种损失函数,放大错误预测像素的梯度贡献。

用于iSAGE框架中以提高模型对错误预测的关注。

人机交互 (Human-in-the-Loop)

在模型训练过程中引入人类专家的参与。

iSAGE通过人机交互识别模型的自信错误。

伪标签 (Pseudo-Labels)

由模型预测生成的标签,用于训练数据扩展。

iSAGE不依赖伪标签,而是直接利用专家点击。

语义分割 (Semantic Segmentation)

将图像中的每个像素分配到一个特定的类别。

iSAGE用于提高遥感图像的语义分割效率。

开放问题 这项研究留下的未解疑问

  • 1 如何在大规模数据集上验证iSAGE的性能?当前实验仅在小规模数据集上进行。
  • 2 iSAGE在处理复杂边界时的表现如何?是否需要结合其他方法?

应用场景

近期应用

城市规划

通过iSAGE提高城市遥感图像的分割效率,减少标注成本。

环境监测

利用iSAGE快速识别环境变化,支持生态保护。

远期愿景

全球遥感数据分析

iSAGE可以应用于全球范围的遥感数据分析,支持跨地区的环境监测和资源管理。

原文摘要

Semantic segmentation in remote sensing requires costly pixel-level annotations, and nearly every problem demands a new dataset since models rarely transfer across sensors, platforms, or geographies. Existing human-in-the-loop frameworks expand sparse clicks into dense supervision via auxiliary machinery (pseudo-labels, propagation, CRFs, foundation-model prompts, auxiliary heads), all operating on the model's predictive distribution. A confidently wrong pixel is indistinguishable from a confidently correct one in that distribution by construction, so no rule reading it can separate the two; the distinguishing signal is external to the model. This paper hypothesizes that expert clicks targeting confident model errors, not arbitrary pixels, suffice to match dense supervision, with no expansion machinery. iSAGE (Iterative Sparse Annotation Guided by Expert) realizes this hypothesis on an integrated open-source platform, where an error-weighted loss amplifies the gradient at each click and the annotation record itself is the dataset, extensible, correctable, and auditable. Experiments use a minimum-effort regime: at most one labeled pixel per class per frame. On BsB Aerial, iSAGE recovers 97.2% of dense supervision (74.79% mIoU on 0.040% of pixels) with contrasting class dynamics: amorphous classes (permeable areas) saturate from the seed, while small classes (cars) require late-iteration effort. On ISPRS Vaihingen (external benchmark), iSAGE reaches 76.78% mIoU with 0.011% of pixels, matching the dense baseline (76.65%) and exceeding all published methods. Under the same pipeline, four output-reading mechanisms (oracle entropy across budgets 1--100x, pseudo-labels across thresholds 0.90--0.99, CRF-based propagation, uniform random) plateau 7.4 to 14.5 pp below iSAGE. Across 31 surveyed methods, iSAGE is the only iterative human-in-the-loop framework operating without auxiliary machinery.

cs.CV