EditCLEVR: A Paired-Scene Intervention Benchmark for Compositional Faithfulness of Object-Centric Representations

TL;DR

EditCLEVR: 提供对象中心表示的组合忠实性基准,评估语义编辑后的表现。

cs.CV 🔴 高级 2026-07-20 4 次浏览
Anuraag Gadehothur Karnam Tarunesh Sathish
对象中心学习 语义编辑 基准测试 组合忠实性 CLEVR

核心发现

方法论

EditCLEVR通过CLEVR风格的场景对比,评估对象中心表示在语义编辑后的表现。每个场景对包含一个已知属性变化或无编辑重渲染,用于漂移测量。使用无探针诊断和探针解码语义忠实性指标。

关键结果

  • 在CoGenT-OOD-core上,基于真实掩码的模型表现下降,表明语义忠实性不仅依赖于掩码来源。
  • 实验表明,局部性或稳定性单独可能夸大语义忠实性。
  • 在不同模型上进行基线评估,发现掩码来源仅部分影响性能。

研究意义

EditCLEVR提供了一个新的评估框架,直接测试对象中心表示在语义编辑下的表现。它强调了组合的泛化和OOD转移,帮助研究人员更好地理解对象表示的稳定性和忠实性。

技术贡献

EditCLEVR引入了场景图干预准确性(SGIA)和Delta-SGIA,提供了严格的对象属性场景图度量。它还展示了在真实掩码下的组合OOD降级现象。

新颖性

EditCLEVR首次提供了一个直接测试对象中心表示在语义编辑下表现的基准。与现有方法不同,它强调了组合忠实性和OOD转移。

局限性

  • EditCLEVR是合成的,限制在CLEVR派生场景,四个离散属性和单对象编辑。
  • 基线评估仅覆盖部分对象中心、生成或VLM系统。

未来方向

未来工作可以扩展到自然图像、关系或连续编辑、多对象编辑,以及更强的发现来源。

AI 总览摘要

EditCLEVR是一个新的基准,用于评估对象中心表示在语义编辑下的表现。现有评估方法通常关注分割或单图像因素预测,但未直接测试对象表示在语义编辑下的表现。EditCLEVR通过CLEVR风格的场景对比,提供了一个严格的评估框架。

该基准包含一对场景,每个场景对包含一个已知属性变化或无编辑重渲染。通过无探针诊断和探针解码语义忠实性指标,EditCLEVR能够评估表示变化是否局限于编辑对象,未编辑对象是否保持稳定,以及解码的对象属性图是否仅在预期方式上变化。

EditCLEVR的贡献包括引入场景图干预准确性(SGIA)和Delta-SGIA,提供了严格的对象属性场景图度量。基线评估表明,在真实掩码下,组合OOD降级现象仍然存在。未来工作可扩展到自然图像和多对象编辑。

深度分析

研究背景

对象中心学习旨在通过对象及其属性来表示场景,以便在新场景中重新组合熟悉的因素。现有评估方法通常关注分割、单图像因素预测或下游准确性,但未直接测试对象表示在语义编辑下的表现。

核心问题

现有评估方法未直接测试对象表示在语义编辑下的表现。分割指标仅询问对象是否被发现,因素探针询问属性在单图像中是否可解码,而下游准确性混合了表示质量与任务特定捷径。

核心创新

EditCLEVR通过CLEVR风格的场景对比,提供了一个严格的评估框架。每个场景对包含一个已知属性变化或无编辑重渲染,用于漂移测量。通过无探针诊断和探针解码语义忠实性指标,EditCLEVR能够评估表示变化是否局限于编辑对象。

方法详解

  • �� 使用CLEVR风格的场景对比进行评估
  • �� 每个场景对包含一个已知属性变化或无编辑重渲染
  • �� 使用无探针诊断评估表示变化是否局限于编辑对象
  • �� 使用探针解码语义忠实性指标评估解码的对象属性图是否仅在预期方式上变化

实验设计

实验设计包括使用真实掩码骨干、学习槽模型、SAM 2 + 冻结ViT模型和一个掩码特征混合进行基线评估。评估对象中心表示在语义编辑下的表现。

结果分析

实验表明,局部性或稳定性单独可能夸大语义忠实性。基线评估表明,在真实掩码下,组合OOD降级现象仍然存在。

应用场景

EditCLEVR可用于评估对象中心表示在语义编辑下的表现,帮助研究人员更好地理解对象表示的稳定性和忠实性。

局限与展望

EditCLEVR是合成的,限制在CLEVR派生场景,四个离散属性和单对象编辑。基线评估仅覆盖部分对象中心、生成或VLM系统。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。每个食材都是一个对象,每个对象都有颜色、大小、形状等属性。EditCLEVR就像一个食谱,告诉你如何在不改变其他食材的情况下改变一个食材的属性。它评估你是否能正确地改变食材的颜色或大小,同时保持其他食材的稳定。

简单解释 像给14岁少年讲一样

嘿,想象一下你在玩一个游戏,你可以改变游戏中的一个角色的颜色或大小,而不影响其他角色。EditCLEVR就像一个工具,帮助你评估这些变化是否正确。它就像一个超级酷的编辑器,让你看到变化后的效果!

术语表

CLEVR风格渲染

一种用于生成合成场景的图像渲染技术。

用于生成EditCLEVR中的场景对。

对象中心表示

一种通过对象及其属性来表示场景的方法。

EditCLEVR用于评估这种表示的忠实性。

语义编辑

对场景中的对象属性进行有意义的修改。

EditCLEVR评估对象中心表示在语义编辑下的表现。

场景图干预准确性(SGIA)

一种评估对象属性场景图变化是否符合预期的指标。

EditCLEVR中用于评估语义忠实性。

组合OOD转移

评估模型在组合的分布外转移能力。

EditCLEVR强调这种转移能力。

开放问题 这项研究留下的未解疑问

  • 1 如何在自然图像中扩展EditCLEVR的评估框架?
  • 2 如何处理多对象编辑的复杂性?

应用场景

近期应用

对象中心表示评估

帮助研究人员评估对象中心表示在语义编辑下的表现。

远期愿景

自然图像评估

扩展EditCLEVR到自然图像,以评估对象表示的稳定性和忠实性。

原文摘要

Object-centric learning aims to represent scenes as objects whose properties can be reused in new combinations. Existing evaluations usually score segmentation, single-image factor prediction, or downstream accuracy, but these tests do not directly ask whether a per-object representation behaves correctly under a controlled semantic edit. We introduce EditCLEVR, a paired-scene intervention benchmark in which each example contains a before/after pair of CLEVR-style renders with the same object indices and scene layout, and either exactly one known attribute change on one known object or a no-edit re-render for drift measurement. The protocol includes probe-free diagnostics for representation-change localization and stability, together with probe-decoded semantic faithfulness metrics that test whether the predicted scene change matches the intended intervention across in-distribution and compositional out-of-distribution (OOD) suites, allowing code-space movement and decoded object-attribute correctness to be evaluated separately. We introduce the semantic metric Scene-Graph Intervention Accuracy (SGIA), which requires the full after-scene prediction to be correct and the only predicted before-to-after semantic change to be the intended object-factor edit. We also establish Delta-SGIA as a companion diagnostic that checks the single-site change pattern without requiring the full after-scene graph to be correct. Baseline evaluations on ground-truth-mask backbones, learned-slot models, SAM 2 + frozen-ViT models, and one mask-feature hybrid indicate that CoGenT-OOD-core degradation can persist under ground-truth instance masks, that mask source accounts for part but not all of native performance, and that locality or stability alone can overstate semantic faithfulness. Code is available at https://github.com/torux-bughunter/EditCLEVR.

cs.CV cs.LG