Vision Harnessing Agent for Open Ad-hoc Segmentation

TL;DR

VASA在开放即席分割中超越SAM3 Agent 14-25%。

cs.CV 🔴 高级 2026-05-19 5 次浏览
Zilin Wang Stella X. Yu
计算机视觉 分割 视觉代理 开放词汇 即席概念

核心发现

方法论

VASA是一种无需训练的视觉引导即席分割代理,结合了视觉语言模型(VLM)、分割基础模型和视觉工作流。其核心机制是通过持久工作掩码进行推理、构建和验证解决方案,计划视觉操作、调用分割工具、检查结果、编辑掩码并从错误中恢复。

关键结果

  • 在PARS基准上,VASA比SAM3 Agent提高了13.5%-25.3%的gIoU和cIoU,xIoU降低了25.3%,表明与语义相关概念的混淆减少。
  • 在RefCOCOm基准上,VASA在part-level概念上比SAM3 Agent提高了8.8%的gIoU,在object-level概念上提高了5.9%。
  • VASA在没有任务特定训练的情况下,性能与在PartImageNet上训练的VLPart相当。

研究意义

VASA在开放即席分割中展示了视觉构建的有效性,超越了现有的开放词汇、推理基础和代理基线。其工作为AI代理提供了一条超越将基础模型作为工具的路径,通过编程任务知识、VLM行为、视觉例程、工作记忆和故障感知工作流来实现。

技术贡献

VASA通过完整的视觉引导工程实现了长期推理,维持持久的视觉状态,与现有方法相比,提供了新的工程可能性。与SAM3 Agent不同,VASA不依赖于语言提示的修正,而是通过视觉操作逐步构建解决方案。

新颖性

VASA是第一个用于开放即席分割的视觉引导代理,其新颖性在于结合VLM和分割基础模型,通过持久的工作掩码进行视觉构建,而非仅依赖语言提示。

局限性

  • VASA在处理非常复杂的视觉概念时可能需要较长的推理时间和更多的计算资源。
  • 在某些情况下,VASA可能无法完全避免语义相关概念之间的混淆。

未来方向

未来的研究方向包括优化VASA的推理效率,减少计算开销,以及扩展其在其他视觉任务中的应用潜力。

AI 总览摘要

开放即席分割是计算机视觉领域的一个重大挑战,因为它需要在没有预定义概念的情况下进行分割。现有的方法,如SAM3 Agent,主要依赖于语言提示的修正,但在处理复杂的视觉概念时表现有限。

VASA(视觉引导即席分割代理)通过结合视觉语言模型和分割基础模型,提供了一种无需训练的解决方案。其核心创新在于使用持久的工作掩码进行推理和构建,允许复杂的视觉概念通过简单视觉原语逐步构建。

实验结果表明,VASA在PARS和RefCOCOm基准上显著优于现有方法,展示了视觉构建在开放即席分割中的有效性。这项工作为AI代理提供了新的路径,超越了将基础模型仅作为工具的传统方法。

深度分析

研究背景

分割技术在计算机视觉中已取得显著进展,尤其是在已知概念的情况下,现代基础模型能够有效地分割熟悉的视觉整体。然而,当涉及开放即席概念时,分割仍然具有挑战性,因为这些概念需要在推理过程中从图像证据中构建。

核心问题

开放即席分割的核心问题在于需要在没有预定义概念的情况下进行分割。这种情况下,用户可能会请求一个涉及部分、关系、排除或集合的任意概念,要求分割器在像素级别上发现相关概念并构建解决方案。

核心创新

VASA的核心创新在于其无需训练的框架,结合了视觉语言模型和分割基础模型,通过持久的工作掩码进行推理和构建。与现有方法不同,VASA不依赖于语言提示的修正,而是通过视觉操作逐步构建解决方案。

方法详解

  • �� VASA结合VLM和分割基础模型,通过持久的工作掩码进行推理和构建。
  • �� 计划视觉操作,调用分割工具,检查结果,编辑掩码并从错误中恢复。
  • �� 构建PARS基准,将PartImageNet中的部分级标签转化为开放即席概念。

实验设计

实验设计包括在PARS和RefCOCOm基准上评估VASA的性能。PARS基准通过长形式定义查询将PartImageNet中的部分级标签转化为开放即席概念。RefCOCOm基准用于评估多粒度指代分割的性能。

结果分析

在PARS基准上,VASA比SAM3 Agent提高了13.5%-25.3%的gIoU和cIoU,xIoU降低了25.3%。在RefCOCOm基准上,VASA在part-level概念上比SAM3 Agent提高了8.8%的gIoU。

应用场景

VASA可用于需要开放即席分割的应用场景,如自动驾驶中的动态场景理解和机器人视觉中的复杂任务执行。

局限与展望

VASA在处理非常复杂的视觉概念时可能需要较长的推理时间和更多的计算资源。在某些情况下,VASA可能无法完全避免语义相关概念之间的混淆。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,VASA就像一个聪明的助手。你告诉它你想要一个特定的菜,比如没有胡萝卜的炒饭。VASA不会从食谱书中找现成的,而是根据你的要求,逐步选择和排除食材,直到做出你想要的菜。这个过程就像VASA在图像中找到你想要的部分,排除不需要的部分,直到得到正确的分割结果。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,任务是找到地图上特定的物品。VASA就像一个超级智能的助手,你告诉它要找什么,它会一步步在地图上标记出你要的东西,并排除不相关的部分。就像在游戏中,你可能要找一个没有怪物的宝箱,VASA会帮你找到这个宝箱,并确保没有怪物在附近!

术语表

开放即席分割 (Open Ad-hoc Segmentation)

在没有预定义概念的情况下进行图像分割的过程。

VASA用于解决开放即席分割问题。

视觉语言模型 (Vision-Language Model)

结合视觉和语言信息进行推理的模型。

VASA结合VLM进行视觉推理。

持久工作掩码 (Persistent Working Mask)

在推理过程中持续更新的图像掩码。

VASA使用持久工作掩码进行视觉构建。

PARS基准 (PARS Benchmark)

用于评估开放即席分割性能的新基准。

VASA在PARS基准上进行评估。

RefCOCOm基准 (RefCOCOm Benchmark)

用于评估多粒度指代分割性能的基准。

VASA在RefCOCOm基准上进行测试。

开放问题 这项研究留下的未解疑问

  • 1 如何在不增加计算开销的情况下提高VASA的推理效率?
  • 2 VASA如何在处理更复杂的视觉概念时保持高效?

应用场景

近期应用

自动驾驶

VASA可以用于识别动态场景中的复杂对象,提高自动驾驶的安全性和效率。

远期愿景

机器人视觉

VASA可以帮助机器人在复杂环境中执行任务,如在工厂中识别和处理特定物品。

原文摘要

Segmentation has become easy when the concept is known, requiring retrieval of a learned visual grounding from text. It remains hard for open ad-hoc concepts, where the grounding may not exist as one learned mask and must often be constructed from image evidence through parts, relations, exclusions, and collections. We propose a Vision-guided Ad-hoc Segmentation Agent (VASA), the first vision harnessing agent for open ad-hoc segmentation. VASA is training-free and couples a VLM agent, a segmentation foundation model, and a visually grounded workflow. Rather than revising text prompts alone, VASA uses a persistent working mask to reason, construct, and validate a solution. It plans visual operations, invokes segmentation tools, inspects results, edits the mask, and recovers from errors. We construct PARS, a new benchmark that turns part-level labels in PartImageNet into open ad-hoc concepts through long-form definition queries. On PARS, VASA outperforms open-vocabulary, reasoning-based, and agentic baselines, surpassing SAM3 Agent by 14-25%. On RefCOCOm, a standard multi-granularity referring segmentation benchmark, VASA improves over SAM3 Agent by 5-9% and over other agentic baselines by up to 20%. These results validate agentic visual construction for open ad-hoc segmentation. Our work points to a path for AI agents beyond wrapping foundation models as tools: Programming them with task knowledge, VLM behavior, visual routines, working memory, and failure-aware workflows.

cs.CV