Beyond Spatial Compression: Interface-Centric Generative States for Open-World 3D Structure

TL;DR

提出C2LT-3D方法,通过接口中心生成状态提升开放世界3D结构的装配鲁棒性,分离局部几何、组件归属和接缝关系。

cs.LG 🔴 高级 2026-05-11 35 次浏览
Xiang Chen Alexander Binder
3D生成 接口中心 开放世界 装配验证 结构修复

核心发现

方法论

提出C2LT-3D,将3D表示分解为局部几何、分区上下文和接缝变量。通过无监督分区和接缝先验,支持装配验证、结构修复和约束解码。

关键结果

  • 在Objaverse-LVIS数据集上,C2LT-3D的分离得分达到0.9780,高于BPT的0.9220,同时污染率仅为0.0141,显著优于基线。
  • 在零样本传输中,C2LT-3D实现了Chamfer距离0.0268和Hausdorff距离0.2282,均优于现有方法。
  • 通过接缝修复实验,C2LT-3D在对抗性装配场景中表现出更高的鲁棒性,显著减少了结构错误。

研究意义

该研究重新定义了3D生成表示的评估标准,不仅关注重建精度,还强调离散状态在装配级结构推理中的可操作性。这对复杂3D资产的生成和修复具有重要意义。

技术贡献

C2LT-3D通过接口中心生成状态,解决了压缩型表示中局部形状、组件归属和装配关系纠缠的问题,为开放世界3D生成提供了新的理论框架。

新颖性

首次提出接口中心生成状态,将3D生成从被动压缩转变为主动结构构建,显著提升了开放世界资产的装配和修复能力。

局限性

  • 依赖无监督分区的准确性,可能在复杂组件中出现误差。
  • 接缝先验的训练需要大量计算资源。
  • 当前方法未完全解决全局拓扑闭合问题。

未来方向

未来可探索更高效的分区算法、更强的全局拓扑约束,以及在动态场景中的应用。

AI 总览摘要

当前3D生成方法多以空间压缩为核心,忽略了组件归属和装配关系的显式建模,导致在开放世界资产中表现不佳。

本文提出C2LT-3D方法,通过接口中心生成状态,将3D表示分解为局部几何、分区上下文和接缝变量。该方法支持装配验证、结构修复和约束解码,无需后处理模块即可实现组件级结构推理。

实验表明,C2LT-3D在Objaverse-LVIS数据集上显著优于基线方法,在零样本传输和对抗性装配场景中表现出更高的鲁棒性。这为开放世界3D生成提供了新的方向,但仍需解决全局拓扑闭合等挑战。

深度分析

研究背景

传统3D生成方法如PolyGen和MeshGPT以压缩几何为目标,适用于单一组件的CAD模型,但在复杂多组件资产中表现不佳。

核心问题

现有方法将局部形状、组件归属和装配关系混合在潜在流中,缺乏对装配级结构推理的支持,导致开放世界资产中结构错误频发。

核心创新

C2LT-3D提出接口中心生成状态,分解表示为局部几何、分区上下文和接缝变量,解决了压缩型表示的三大失效模式。

方法详解

  • �� 局部几何编码:通过部分规范化去除姿态变化。
  • �� 分区上下文:利用无监督分区减少组件间干扰。
  • �� 接缝先验:预测接缝兼容性、相对变换和碰撞风险。

实验设计

在ShapeNet上训练,在Objaverse-LVIS上零样本测试。对比BPT和VQ-Patch,评估Chamfer距离、分离得分等。

结果分析

C2LT-3D在分离得分、污染率和Chamfer距离上均优于基线,尤其在复杂装配场景中表现出色。

应用场景

适用于复杂3D资产的生成、修复和装配验证,如工业设计和虚拟现实。

局限与展望

依赖分区和接缝预测的准确性,未完全解决全局拓扑问题,计算成本较高。

通俗解读 非专业人士也能看懂

想象一个拼图游戏,每块拼图都有形状、颜色和边缘信息。传统方法只关注拼图的形状,而C2LT-3D不仅记录形状,还标记每块拼图属于哪个部分,以及哪些边缘可以拼接。这让拼图更容易修复和组装。

简单解释 像给14岁少年讲一样

想象你在玩乐高积木。普通方法只告诉你积木的形状,而C2LT-3D会告诉你每块积木属于哪个部分,还会检查它们能不能拼在一起。是不是很酷?

术语表

C2LT-3D

一种接口中心的3D生成方法,分解几何、上下文和接缝变量。

用于开放世界3D资产的生成和修复。

接口中心生成状态

一种显式建模几何、组件归属和装配关系的生成表示。

C2LT-3D的核心思想。

分区上下文

通过无监督分区减少组件间干扰的上下文建模方法。

用于组件级结构推理。

接缝先验

预测接缝兼容性、变换和碰撞风险的模型。

支持装配验证和修复。

Objaverse-LVIS

一个包含复杂多组件资产的开放世界数据集。

用于零样本测试。

开放问题 这项研究留下的未解疑问

  • 1 如何提升无监督分区的准确性以减少误差?
  • 2 如何高效实现全局拓扑闭合?
  • 3 是否能扩展到动态场景中?

应用场景

近期应用

工业设计

支持复杂机械组件的装配验证和修复,提升设计效率。

虚拟现实

用于虚拟场景中多组件物体的生成和交互。

远期愿景

动态场景建模

扩展到动态环境中,实现实时装配和修复。

原文摘要

Current 3D tokenizers largely treat representation as spatial compression: compact codes reconstruct surface geometry, but leave component ownership and attachment validity implicit. In open-world assets with intersecting components, noisy topology, and weak canonical structure, this creates a representation mismatch: local shape, component identity, and assembly relations become entangled in a latent stream and are not natively addressable during decoding. We formulate an alternative view, interface-centric generative states, in which tokenization constructs an operational state rather than a passive compressed code. The state exposes local geometry, component ownership, and attachment validity as variables that can be queried, constrained, and repaired during decoding. We instantiate this formulation with Component-Conditioned Canonical Local Tokens (C2LT-3D), factorizing representation into canonical local geometry, partition-conditioned context, and relational seam variables. Each factor targets a distinct failure mode of compression-centric tokens: pose leakage, cross-component interference, or invalid local attachment. This exposed state supports attachment validation, latent structural repair, targeted intervention, and constrained serialization without a separate post-hoc structure recovery module. Trained on single-object CAD models and evaluated zero-shot on open-world multi-component assets, C2LT-3D improves structural robustness and shows that its latent variables remain actionable under adversarial attachment settings. These results suggest that open-world 3D generative representations should be evaluated not only by reconstruction fidelity, but by whether their discrete states remain operational for assembly-level structural reasoning.

cs.LG cs.CV