VGGT-Occ: Geometry-Grounded and Density-Aware Gated Fusion for 3D Occupancy Prediction

TL;DR

VGGT-Occ通过几何嵌入和密度感知门控融合提升3D占据预测,达到33.64% IoU。

cs.CV 🔴 高级 2026-05-16 33 次浏览
Xun Chen Tianchen Deng Rui Wang Fangjinhua Wang Junyi Ma Hongming Shen Hesheng Wang Danwei Wang
3D占据预测 几何嵌入 密度感知 门控融合 自动驾驶

核心发现

方法论

VGGT-Occ框架通过几何嵌入和密度感知门控融合提升3D占据预测。引入投影感知可变形注意力(PA-DA),在所有注意力阶段注入几何信息。使用序列粗到细解码器,通过信息密度分配计算资源,显著降低解码器成本。

关键结果

  • 在SurroundOcc-nuScenes数据集上,VGGT-Occ在T=1时实现33.00% IoU和21.08% mIoU,T=2时实现33.64% IoU和21.43% mIoU,优于现有方法。
  • VGGT-Occ仅使用约41M可训练参数,实现了卓越的性能和效率。
  • 通过消融实验验证了PA-DA各阶段的独立贡献。

研究意义

该研究在学术界和工业界具有重要影响,解决了长期存在的几何信息利用不足的问题。通过几何嵌入和密度感知门控融合,提升了3D占据预测的准确性和效率。

技术贡献

技术贡献包括引入几何感知的注意力机制和密度感知的计算分配策略,与现有方法相比具有根本性差异,提供了新的理论保证和工程可能性。

新颖性

VGGT-Occ首次在整个注意力阶段注入几何信息,与最相关的工作相比,提供了更深层次的几何推理和信息密度驱动的计算分配。

局限性

  • 在极端视角情况下,几何信息可能不足以完全消除观察质量的影响。
  • 对计算资源的需求较高,可能限制在低端设备上的应用。

未来方向

未来工作可探索在更复杂场景中应用VGGT-Occ框架,并优化计算资源分配策略。

AI 总览摘要

3D语义占据预测是自动驾驶感知的基石,提供复杂场景的全面几何和语义理解。然而,现有方法在几何信息的利用上存在不足,通常仅在初始投影阶段考虑相机几何。VGGT-Occ框架通过几何嵌入和密度感知门控融合解决这一问题。引入投影感知可变形注意力(PA-DA),在所有注意力阶段注入几何信息,并通过序列粗到细解码器优化计算资源分配。实验结果表明,VGGT-Occ在SurroundOcc-nuScenes数据集上实现了33.64% IoU和21.43% mIoU,优于现有方法。尽管取得了显著进展,仍需在极端视角情况下进一步优化几何信息的利用。未来工作将探索在更复杂场景中的应用,并优化计算资源分配策略。

深度分析

研究背景

3D语义占据预测是自动驾驶感知的关键技术,旨在从多相机2D图像恢复完整的3D结构。现有方法在几何信息的利用上存在不足,通常仅在初始投影阶段考虑相机几何,后续操作如偏移学习、注意力加权和跨相机聚合则忽略了几何约束。

核心问题

核心问题在于如何在整个注意力阶段有效利用几何信息,以提升3D占据预测的准确性和效率。现有方法在几何信息的利用上存在不足,通常仅在初始投影阶段考虑相机几何。

核心创新

VGGT-Occ通过几何嵌入和密度感知门控融合解决了几何信息利用不足的问题。引入投影感知可变形注意力(PA-DA),在所有注意力阶段注入几何信息,并通过序列粗到细解码器优化计算资源分配。

方法详解

  • �� 引入投影感知可变形注意力(PA-DA),在所有注意力阶段注入几何信息。
  • �� 使用序列粗到细解码器,通过信息密度分配计算资源,显著降低解码器成本。
  • �� 通过几何嵌入和密度感知门控融合提升3D占据预测的准确性和效率。

实验设计

在SurroundOcc-nuScenes数据集上进行实验,评估VGGT-Occ的性能。使用IoU和mIoU作为评估指标,进行消融实验验证PA-DA各阶段的独立贡献。

结果分析

VGGT-Occ在SurroundOcc-nuScenes数据集上实现了33.64% IoU和21.43% mIoU,优于现有方法。通过消融实验验证了PA-DA各阶段的独立贡献。

应用场景

VGGT-Occ可应用于自动驾驶感知,提供复杂场景的全面几何和语义理解。通过几何嵌入和密度感知门控融合提升3D占据预测的准确性和效率。

局限与展望

在极端视角情况下,几何信息可能不足以完全消除观察质量的影响。对计算资源的需求较高,可能限制在低端设备上的应用。

通俗解读 非专业人士也能看懂

想象你在一个厨房里,准备做一道复杂的菜肴。你需要从不同的角度观察食材,确保每个步骤都准确无误。VGGT-Occ就像一个聪明的助手,帮助你从不同的视角获取食材的信息,并根据食材的密度分配你的注意力。这样,你就能在不浪费时间和资源的情况下,做出完美的菜肴。

简单解释 像给14岁少年讲一样

嘿,想象一下你在玩一个超酷的游戏,你需要从不同的视角观察游戏中的角色和场景。VGGT-Occ就像一个超级助手,帮助你从不同的视角获取角色的信息,并根据角色的密度分配你的注意力。这样,你就能在不浪费时间和资源的情况下,赢得游戏!是不是很酷?

术语表

投影感知可变形注意力 (Projection-Aware Deformable Attention)

一种在所有注意力阶段注入几何信息的机制,提升3D占据预测的准确性。

用于在VGGT-Occ框架中提升几何信息的利用。

几何嵌入 (Geometric Embedding)

在整个注意力阶段注入几何信息,提升3D占据预测的准确性。

用于在VGGT-Occ框架中提升几何信息的利用。

密度感知门控融合 (Density-Aware Gated Fusion)

通过信息密度分配计算资源,显著降低解码器成本。

用于在VGGT-Occ框架中优化计算资源分配。

IoU (交并比)

一种评估3D占据预测准确性的指标,衡量预测与真实值的重叠程度。

用于评估VGGT-Occ在SurroundOcc-nuScenes数据集上的性能。

mIoU (平均交并比)

一种评估3D占据预测准确性的指标,衡量每个类别的预测与真实值的重叠程度。

用于评估VGGT-Occ在SurroundOcc-nuScenes数据集上的性能。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端视角情况下进一步优化几何信息的利用?
  • 2 如何在低端设备上应用VGGT-Occ框架?

应用场景

近期应用

自动驾驶感知

VGGT-Occ可应用于自动驾驶感知,提供复杂场景的全面几何和语义理解。

智能监控系统

可用于智能监控系统,提升多视角下的目标检测和跟踪能力。

远期愿景

智能城市建设

在智能城市建设中应用VGGT-Occ框架,提升城市规划和管理的效率。

原文摘要

3D semantic occupancy prediction requires accurate 2D-to-3D feature lifting, yet current methods restrict camera geometry to initial projections. Subsequent operations like offset learning, attention weighting, and cross-camera aggregation remain geometry-agnostic, ignoring essential physical constraints. We propose VGGT-Occ, a framework that embeds geometric tokens throughout the entire pipeline. We introduce Projection-Aware Deformable Attention (PA-DA) to inject geometry into all attention stages. PA-DA projects 3D offsets back to image planes and leverages the projection Jacobian as an additive bias to suppress unreliable observations. Features are then integrated through a view-quality semantic gate for cross-view consistency. To optimize both efficiency and performance, we employ a sequential coarse-to-fine decoder with gated fusion, where low-resolution features are refined into higher resolutions, allocating computation by information density while substantially reducing decoder cost. Extensive evaluations demonstrate the effectiveness and accuracy of our approach. On SurroundOcc-nuScenes, VGGT-Occ achieves 33.00\% IoU and 21.08\% mIoU ($T{=}1$), and 33.64\% IoU and 21.43\% mIoU with $T{=}2$ inference, outperforming existing methods, with only ${\sim}41$M trainable parameters in the occupancy head. Code will be released publicly.

cs.CV