cs.CV 1711.08496

Temporal Relational Reasoning in Videos

Proposes Temporal Relation Network (TRN) for multi-scale temporal reasoning, boosting activity recognition accuracy by over 20% on key datasets.

Bolei Zhou, Alex Andonian, Aude Oliva et al.

2017-11-23 44
cs.CV 1711.07566

Neural 3D Mesh Renderer

Proposes a differentiable mesh renderer with approximate gradients, enabling single-image 3D mesh reconstruction and editing using 2D supervision.

Hiroharu Kato, Yoshitaka Ushiku, Tatsuya Harada

2017-11-21 64
cs.CV 1711.06077

The Perception-Distortion Tradeoff

Mathematical proof of perception-distortion tradeoff; GANs approach the boundary; new evaluation framework proposed.

Yochai Blau, Tomer Michaeli

2017-11-16 31
cs.CV 1709.07871

FiLM: Visual Reasoning with a General Conditioning Layer

Introduces FiLM: Feature-wise Linear Modulation, reducing error on CLEVR from 4.5% to 2.3%, surpassing prior state-of-the-art in visual reasoning.

Ethan Perez, Florian Strub, Harm de Vries et al.

2017-09-23 4590 citations 29
cs.CV 1709.06158

Matterport3D: Learning from RGB-D Data in Indoor Environments

Matterport3D provides a large-scale indoor RGB-D panorama dataset with 10,800 views, enabling multi-task scene understanding including keypoint matching and semantic segmentation.

Angel Chang, Angela Dai, Thomas Funkhouser et al.

2017-09-19 29