Early Warning Signals for OpenVLA Failure under Visual Distribution Shift
By freezing OpenVLA policy, linear probes detect failure signals under visual distribution shift, achieving AUROC of 0.972.
Dipesh Tharu Mahato, Rachel Ren
By freezing OpenVLA policy, linear probes detect failure signals under visual distribution shift, achieving AUROC of 0.972.
Dipesh Tharu Mahato, Rachel Ren
Introduced MultiDepth-3k benchmark and Laplacian Visual Prompting (LVP) to probe depth-layer preferences; DAv2-L achieved 75.5% ML-SRA.
Xiaohao Xu, Feng Xue, Xiang Li et al.
MIRROR employs Gromov–Wasserstein regularization to transfer semantic relation geometry from language to vision, boosting multimodal relational reasoning.
Hong-Han Wang, Yuntao Wang, Hu Ding
Proposed a self-supervised framework using eight phase-shift images to learn subsurface scattering representations.
Arjun Majumdar, Raphael Braun, Andreas Engelhardt et al.
TASKER algorithm improves video understanding by task-driven and scene-aware keyframe extraction, achieving a 2.0% gain on EgoSchema.
Sunqi Fan, Qingle Liu, Runqi Yin et al.
TrafficAlign synthesizes traffic scenarios from videos, uses DSL validation, and fine-tunes LLMs for regional traffic distribution alignment, improving autonomous driving safety.
Zhi Tu, Liangkun Niu, Tianyi Zhang
DLGStream introduces dual-opacity language Gaussian representation with deformation fields, achieving 43KB/frame and 60FPS in open-vocabulary free-viewpoint video streaming.
Zhihui Ke, Yuyang Liu, Xiaobo Zhou et al.
Ground4D integrates VGGT-based geometry initialization with deformable Gaussian Splatting for monocular 4D scene reconstruction and novel view synthesis, achieving state-of-the-art accuracy.
Qing Zhao, Weijian Deng, Pengxu Wei et al.
CoGS introduces a compositional Gaussian splatting framework with a six-stage optimization for monocular human-object scene reconstruction, achieving state-of-the-art fidelity.
Jerrin Bright, John Zelek
Obliviate effectively erases concepts in autoregressive image generation, reducing nudity detection on RAB benchmark from 91.58% to 3.15%.
Hossein Shakibania, Jonas Henry Grebe, Tobias Braun et al.
StructSplat is a pose-free 3D Gaussian reconstruction framework achieving +5.67 dB PSNR over SOTA on DL3DV.
Jia-Chen Zhao, Beiqi Chen, Xinyang Chen et al.
Introduced Parallel Rollout Approximation (PRA) achieving 1.94 FID on ImageNet-1K.
Jiayi Xu, Di He, Guolin Ke
Proposed CSD, a content-aware speculative decoding algorithm, achieving 4.33× speedup on MS-COCO.
Mingcheng Wang, Junbo Qiao, Yunchen Li et al.
Video-MME-Logical benchmark reveals significant gaps in MLLMs' video temporal-logical reasoning.
Hohin Kwan, Hongyu Li, Ray Zhang et al.
VulcanVoxel reconstructs blade insertion feasibility in 3D occupancy fields, achieving 0.89 coverage.
Tianyu Li, Harpreet Sawhney, Minju Jung et al.
SAM2Matting leverages pre-trained VOS trackers (e.g., SAM2, SAM3) with region proposal and multi-scale alpha refinement, achieving state-of-the-art zero-shot video and image matting performance.
Ruiqi Shen, Guangquan Jie, Chang Liu et al.
Proposes DexAC-WM, a structured high-DoF action representation, significantly improving visual-temporal prediction accuracy by 15% in FID and 20% in FVD on egocentric datasets.
Zizhao Yuan, Zhengtu Liang, Taowen Wang et al.
Proposes iterative self-improving codebooks leveraging model understanding to enhance image generation safety, reducing harmful content by over 85%.
Yunqi Xue, Zhijiang Li, Philip Torr et al.
SubdivAR enhances mesh subdivision accuracy via autoregressive prediction, reducing Hausdorff Distance by 18.8%.
Huipeng Guo, Zikai Song, Hang Long et al.
Unison evaluates multimodal models' synergy via internal consistency, guided understanding and generation, and mutual enhancement, using 169 samples and a fine-tuned Unison-Judge.
Jinyu Liu, Xincheng Shuai, Henghui Ding et al.