Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding
VEGA-3D leverages implicit 3D priors in video generation models to enhance scene understanding.
Xianjin Wu, Dingkang Liang, Tianrui Feng et al.
VEGA-3D leverages implicit 3D priors in video generation models to enhance scene understanding.
Xianjin Wu, Dingkang Liang, Tianrui Feng et al.
Matryoshka Gaussian Splatting (MGS) enables continuous level of detail control without sacrificing full-capacity rendering quality.
Zhilin Guo, Boqiao Zhang, Hakan Aktas et al.
MonoArt uses progressive structural reasoning for monocular 3D reconstruction, achieving improved accuracy and speed on the PartNet-Mobility dataset.
Haitian Li, Haozhe Xie, Junxiang Xu et al.
MoTok method reduces trajectory error from 0.72 cm to 0.08 cm and FID from 0.083 to 0.029 on HumanML3D.
Chenyang Gu, Mingyuan Zhang, Haozhe Xie et al.
SAMA achieves instruction-guided video editing through semantic anchoring and motion alignment, significantly enhancing editing precision and motion consistency.
Xinyao Zhang, Wenkai Dong, Yuxin Song et al.
EffectErase uses reciprocal learning for high-quality video object removal and insertion, leveraging the VOR dataset.
Yang Fu, Yike Zheng, Ziyun Dai et al.
Spectrally-guided per-instance diffusion noise schedules enhance low-step generative quality.
Carlos Esteves, Ameesh Makadia
DriveTok leverages 3D deformable cross-attention for efficient multi-view reconstruction and understanding, excelling on the nuScenes dataset.
Dong Zhuo, Wenzhao Zheng, Sicheng Zuo et al.
DreamPartGen achieves semantically grounded part-level 3D generation via collaborative latent denoising, improving geometric fidelity by 53%.
Tianjiao Yu, Xinzhuo Li, Muntasir Wahed et al.
State Space Models (SSM) outperform Vision Transformers (ViT) as vision encoders in VLMs, especially in VQA and localization tasks.
Shang-Jui Ray Kuo, Paola Cascante-Bonilla
ARIADNE uses DPO and RL for coronary angiography, achieving a centerline Dice of 0.838.
Zhan Jin, Yu Luo, Yizhou Zhang et al.
SGC metric quantifies 3D geometric consistency in dynamic videos using camera pose divergence, outperforming existing methods.
Weijia Dou, Wenzhao Zheng, Weiliang Chen et al.
GHOST uses Gaussian Splatting for fast hand-object interaction reconstruction from RGB videos, achieving 10x speedup.
Ahmed Tawfik Aboukhadra, Marcel Rogge, Nadia Robertini et al.
Proposed Cross-Modal Context Learning method improves audio-video generation quality with reduced resource requirements.
Bingqi Ma, Linlong Lang, Ming Zhang et al.
Inst4DGS introduces instance-decomposed 4D Gaussian splatting with differentiable Sinkhorn for multi-view consistent tracking, achieving PSNR 28.36 and mIoU 0.9129.
Yonghan Lee, Dinesh Manocha
Introduced Spatio-Temporal Token Scoring (STTS) to enhance video VLMs efficiency by 62% with minimal performance drop.
Jianrui Zhang, Yue Yang, Rohun Tripathi et al.
Loc3R-VLM enables language-based localization and 3D reasoning from monocular video input, outperforming existing methods.
Kevin Qu, Haozhe Qi, Mihai Dusmanu et al.
LoST efficiently tokenizes 3D shapes by semantic salience for autoregressive generation, using only 0.1%-10% of tokens.
Niladri Shekhar Dutt, Zifan Shi, Paul Guerrero et al.
StereoWorld, a camera-conditioned stereo video generator, improves 3D consistency and speed by 3x, using RoPE encoding and attention decomposition.
Yang-Tian Sun, Zehuan Huang, Yifan Niu et al.
Video models exhibit reasoning via Chain-of-Steps mechanism during diffusion denoising steps.
Ruisi Wang, Zhongang Cai, Fanyi Pu et al.