The Effectiveness of Data Augmentation in Image Classification using Deep Learning
This study compares traditional, GAN-based, and neural network learned data augmentation, achieving up to 91.5% accuracy on ImageNet subsets.
Luis Perez, Jason Wang
This study compares traditional, GAN-based, and neural network learned data augmentation, achieving up to 91.5% accuracy on ImageNet subsets.
Luis Perez, Jason Wang
Cascade R-CNN employs multi-stage training with increasing IoU thresholds, achieving 2-4% AP improvements over single-model detectors on COCO.
Zhaowei Cai, Nuno Vasconcelos
Proposed graph distillation method leverages privileged modalities to enhance action detection, achieving superior performance on NTU RGB+D and PKU-MMD.
Zelun Luo, Jun-Ting Hsieh, Lu Jiang et al.
Study shows deep 3D CNNs trained on Kinetics can replicate 2D CNNs and ImageNet success; ResNeXt-101 achieves 78.4% accuracy on Kinetics.
Kensho Hara, Hirokatsu Kataoka, Yutaka Satoh
ARTNet enhances video classification performance on datasets like Kinetics using SMART blocks.
Limin Wang, Wei Li, Wen Li et al.
Proposes SplineCNN with continuous B-spline kernels for fast geometric deep learning.
Matthias Fey, Jan Eric Lenssen, Frank Weichert et al.
Proposes Temporal Relation Network (TRN) for multi-scale temporal reasoning, boosting activity recognition accuracy by over 20% on key datasets.
Bolei Zhou, Alex Andonian, Aude Oliva et al.
UnFlow uses bidirectional Census loss for unsupervised optical flow learning, outperforming supervised methods on KITTI.
Simon Meister, Junhwa Hur, Stefan Roth
Proposes a differentiable mesh renderer with approximate gradients, enabling single-image 3D mesh reconstruction and editing using 2D supervision.
Hiroharu Kato, Yoshitaka Ushiku, Tatsuya Harada
Introduced Matterport3D-based vision-language navigation framework using Seq2Seq, achieving 62.7% success in real indoor environments.
Peter Anderson, Qi Wu, Damien Teney et al.
Mathematical proof of perception-distortion tradeoff; GANs approach the boundary; new evaluation framework proposed.
Yochai Blau, Tomer Michaeli
Relation Network (RN) learns deep relation metrics for few-shot classification, achieving state-of-the-art results without fine-tuning.
Flood Sung, Yongxin Yang, Li Zhang et al.
Proposed a novel CNN architecture for improving dense monocular reconstruction through deeply supervised feature learning.
Chamara Saroj Weerasekera, Ravi Garg, Yasir Latif et al.
NISP propagates final response importance scores for global neuron pruning, achieving significant speedups and compression with minimal accuracy loss.
Ruichi Yu, Ang Li, Chun-Fu Chen et al.
Grad-CAM++: Incorporates second-order derivatives to improve multi-object localization, achieving 70.72% win rate over Grad-CAM.
Aditya Chattopadhyay, Anirban Sarkar, Prantik Howlader et al.
Proposed Deep Laplacian Pyramid Network for fast and accurate image super-resolution.
Wei-Sheng Lai, Jia-Bin Huang, Narendra Ahuja et al.
Introduces FiLM: Feature-wise Linear Modulation, reducing error on CLEVR from 4.5% to 2.3%, surpassing prior state-of-the-art in visual reasoning.
Ethan Perez, Florian Strub, Harm de Vries et al.
AffordanceNet uses end-to-end deep learning for simultaneous object detection and pixel-level affordance recognition, achieving 150ms inference speed.
Thanh-Toan Do, Anh Nguyen, Ian Reid
Matterport3D provides a large-scale indoor RGB-D panorama dataset with 10,800 views, enabling multi-task scene understanding including keypoint matching and semantic segmentation.
Angel Chang, Angela Dai, Thomas Funkhouser et al.
Using Sentinel-2 multispectral data, EuroSAT dataset with ResNet-50 achieves 98.57% accuracy for land use classification.
Patrick Helber, Benjamin Bischke, Andreas Dengel et al.