cs.CV 2311.17005

MVBench: A Comprehensive Multi-modal Video Understanding Benchmark

Proposes MVBench, a comprehensive benchmark for evaluating temporal understanding in multi-modal video models, with a novel static-to-dynamic task transformation and automated QA generation; VideoChat2 surpasses SOTA by over 15%.

Kunchang Li, Yali Wang, Yinan He et al.

2023-11-29 1296 citations 44
cs.CV 2311.16493

Mip-Splatting: Alias-free 3D Gaussian Splatting

Mip-Splatting introduces 3D frequency-constrained smoothing and Mip filtering to eliminate aliasing artifacts in Gaussian Splatting, improving multi-scale view synthesis.

Zehao Yu, Anpei Chen, Binbin Huang et al.

2023-11-27 34
cs.CV 2311.12792

Intrinsic Image Decomposition via Ordinal Shading

Proposes a dual-scale ordinal shading framework for high-res intrinsic image decomposition, outperforming SOTA with detailed, globally consistent results.

Chris Careaga, Yağız Aksoy

2023-11-22 41
cs.CV 2311.12871

An Embodied Generalist Agent in 3D World

LEO, a multi-modal embodied agent trained via 3D VL alignment and instruction tuning, significantly advances 3D scene understanding and interaction.

Jiangyong Huang, Silong Yong, Xiaojian Ma et al.

2023-11-18 39