InstEditSeg: Instruction-Driven Image Editing for Polyp and Skin Lesion Segmentation

TL;DR

InstEditSeg通过指令驱动的图像编辑实现息肉和皮肤病变的分割,显著提高跨域泛化能力。

cs.CV 🔴 高级 2026-09-02 2 次浏览
Ziquan Liu Zhewei Zhu Xuyang Shi
医学图像分割 生成模型 指令驱动 跨域泛化 视觉编码器

核心发现

方法论

InstEditSeg将医学图像分割重新定义为指令驱动的图像编辑任务。通过使用DINOv3作为辅助视觉编码器,构建多尺度特征金字塔,并与扩散U-Net融合。采用双分支无分类器指导策略,减少推理成本。

关键结果

  • 在PolypGen数据集上,InstEditSeg实现了83.92%的Dice系数,显著优于其他方法,展示了强大的跨域泛化能力。
  • 在CVC-ColonDB数据集上,InstEditSeg取得了92.95%的Dice系数,超过所有对比方法。
  • 在ISIC2017数据集上,InstEditSeg以83.14%的Dice系数领先,证明了其在皮肤病变分割中的有效性。

研究意义

InstEditSeg通过生成框架解决了传统分割方法在低对比度和模糊边界上的局限性,特别是在跨域泛化方面表现出色。它为医学图像分割提供了一种新的视角,结合生成模型的视觉先验和指令驱动的任务控制。

技术贡献

InstEditSeg首次将指令驱动的图像编辑应用于医学分割,消除了任务特定的头部,利用扩散模型的潜在视觉先验,实现了更完整的多病变分割和任务控制。

新颖性

InstEditSeg是首个将医学图像分割重新定义为指令驱动的图像编辑任务的框架,突破了传统分割方法的局限,利用生成模型的潜在视觉先验。

局限性

  • InstEditSeg对颜色敏感,在某些情况下可能导致分割结果不准确。
  • 未支持属性条件选择,限制了任务灵活性。

未来方向

未来研究可探索InstEditSeg在其他医学图像领域的应用,并优化其在不同任务中的指令理解能力。

AI 总览摘要

InstEditSeg通过指令驱动的图像编辑实现息肉和皮肤病变的分割,解决了现有方法在低对比度和模糊边界上的局限性。该框架利用DINOv3作为辅助视觉编码器,构建多尺度特征金字塔,并与扩散U-Net融合,显著提高了跨域泛化能力。

在多个数据集上,InstEditSeg展示了卓越的分割性能,特别是在未见数据上的表现尤为突出。其生成框架不仅提高了分割精度,还实现了更完整的多病变分割和任务控制。

尽管InstEditSeg在颜色敏感性和属性条件选择上存在局限,但其创新的指令驱动方法为医学图像分割提供了新的视角,未来研究可进一步优化其在不同任务中的应用。

深度分析

研究背景

医学图像分割是临床诊断的重要环节,传统方法如U-Net已成为标准,但在低对比度和模糊边界上表现不佳。生成模型提供了新的可能性,特别是扩散模型在图像生成中的应用。

核心问题

现有方法在处理低对比度和模糊边界时存在局限,尤其是跨域泛化能力不足。准确分割息肉和皮肤病变对于早期诊断至关重要。

核心创新

InstEditSeg将医学图像分割重新定义为指令驱动的图像编辑任务,利用生成模型的视觉先验,消除任务特定的头部,实现更完整的多病变分割。

方法详解

  • �� 使用DINOv3作为辅助视觉编码器,构建多尺度特征金字塔。
  • �� 与扩散U-Net融合,通过通道连接和零初始化卷积注入分层判别先验。
  • �� 采用双分支无分类器指导策略,减少推理成本。

实验设计

在多个数据集上进行实验,包括Kvasir-SEG、CVC-ClinicDB、PolypGen和ISIC2017。使用Dice系数和IoU作为主要评估指标,比较不同方法的性能。

结果分析

InstEditSeg在PolypGen数据集上实现了83.92%的Dice系数,显著优于其他方法。在CVC-ColonDB数据集上取得了92.95%的Dice系数,超过所有对比方法。

应用场景

InstEditSeg可用于临床诊断中的息肉和皮肤病变分割,特别是在跨域泛化任务中表现出色。

局限与展望

InstEditSeg对颜色敏感,在某些情况下可能导致分割结果不准确。未支持属性条件选择,限制了任务灵活性。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,InstEditSeg就像一个聪明的厨师助手。它能根据你的指令,把食材切成你想要的形状和颜色,而不是简单地把食材分成两半。这样,即使食材形状复杂,它也能准确地完成任务。

简单解释 像给14岁少年讲一样

嘿,小伙伴们!你们知道吗,InstEditSeg就像一个超级智能的游戏角色,它能根据你的指令,在游戏地图上找到隐藏的宝藏!它不仅能找到宝藏,还能告诉你宝藏的颜色和形状。是不是很酷?

术语表

InstEditSeg (指令驱动图像编辑分割)

一种将医学图像分割重新定义为指令驱动图像编辑的框架。

用于息肉和皮肤病变分割。

DINOv3 (视觉编码器)

一种用于提取视觉特征的编码器,帮助恢复细致的解剖结构。

作为辅助视觉编码器。

扩散模型 (Diffusion Model)

一种生成模型,通过迭代去噪实现图像生成。

用于图像编辑和分割。

Dice系数 (Dice Coefficient)

一种评估分割精度的指标,数值越高表示分割效果越好。

用于评估分割性能。

跨域泛化 (Cross-Domain Generalization)

模型在未见数据上的表现能力。

InstEditSeg在PolypGen数据集上的表现。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化InstEditSeg在不同医学图像领域的应用?
  • 2 InstEditSeg在颜色敏感性上的局限如何解决?
  • 3 如何支持属性条件选择以提高任务灵活性?

应用场景

近期应用

临床诊断

InstEditSeg可用于息肉和皮肤病变的自动分割,提高诊断效率。

远期愿景

医学图像分析

InstEditSeg有潜力应用于更广泛的医学图像分析任务,推动自动化医疗。

原文摘要

Accurate segmentation of polyps and skin lesions is pivotal for clinical diagnosis, yet existing methods struggle with low contrast, ambiguous boundaries, and cross-domain distribution discrepancies. Discriminative networks and most diffusion-based segmentation approaches predict standalone binary masks, leaving the visual priors of large-scale pretrained generative models largely unexploited. We propose InstEditSeg, a unified generative framework that reformulates medical segmentation as an instruction-driven image editing problem. Instead of emitting a mask, the model renders a color-coded overlay on the original image, conditioned on a textual instruction, so that the edited output aligns with the natural image distribution learned by latent diffusion models and mitigates the domain gap between natural and medical imagery. To recover fine anatomical structures, we introduce DINOv3 as an auxiliary visual encoder and a DINO Feature Guidance Block that builds a multi-scale feature pyramid. The pyramid is fused into the diffusion U-Net by channel concatenation and zero-initialized convolution so that hierarchical discriminative priors can be injected without perturbing the pretrained weights. A dual-branch classifier-free guidance strategy requiring only two forward passes per denoising step reduces inference cost. On polyp and skin lesion benchmarks the framework achieves accuracy competitive with strong discriminative baselines, and it further demonstrates concrete advantages of the generative formulation: notably better cross-domain generalization on unseen data, more complete multi-lesion segmentation, instruction-conditioned task control, and sampling flexibility. We also analyze the strengths and limitations of the paradigm, including its color sensitivity and unsupported attribute-conditioned selection. Code is available at: https://github.com/wincharm001/InstEditSeg.

cs.CV cs.AI