cs.CV 2303.07677

SR-init: An interpretable layer pruning method

SR-init assesses layer redundancy by measuring accuracy drop after stochastic re-initialization, enabling interpretable pruning with significant parameter reduction.

Hui Tang, Yao Lu, Qi Xuan

2023-03-14 34
cs.CV 2303.07280

Vision-Language Models as Success Detectors

Using Flamingo as a success detector framed as VQA, achieving cross-domain generalization with minimal human annotations.

Yuqing Du, Ksenia Konyushkova, Misha Denil et al.

2023-03-14 42
cs.CV 2303.05511

Scaling up GANs for Text-to-Image Synthesis

GigaGAN introduces a new architecture for text-to-image synthesis, generating 512px images in just 0.13 seconds.

Minguk Kang, Jun-Yan Zhu, Richard Zhang et al.

2023-03-10 31
cs.CV 2303.01418

Human Motion Diffusion as a Generative Prior

Utilizes pre-trained human motion diffusion models for long, multi-person, and controllable motion synthesis via sequence, parallel, and model blending strategies.

Yonatan Shafir, Guy Tevet, Roy Kapon et al.

2023-03-03 422 citations 38
cs.CV 2302.07241

ConceptFusion: Open-set Multimodal 3D Mapping

ConceptFusion leverages foundation models for open-set, multimodal 3D mapping, enabling zero-shot queries with over 40% improvement in 3D IoU.

Krishna Murthy Jatavallabhula, Alihusein Kuwajerwala, Qiao Gu et al.

2023-02-15 63
cs.CV 2302.05442

Scaling Vision Transformers to 22 Billion Parameters

Proposes ViT-22B with parallel layers, QK normalization, and bias removal, achieving stable training at 22B parameters, surpassing prior models.

Mostafa Dehghani, Josip Djolonga, Basil Mustafa et al.

2023-02-11 14
cs.CV 2302.03027

Zero-shot Image-to-Image Translation

pix2pix-zero enables image-to-image translation without manual prompts, preserving original image structure.

Gaurav Parmar, Krishna Kumar Singh, Richard Zhang et al.

2023-02-07 32
cs.CV 2302.00673

ADAPT: Action-aware Driving Caption Transformer

ADAPT, a Transformer-based multi-task model, jointly predicts driving actions and generates natural language explanations, achieving CIDEr 34.6 and reasoning 11.4 on BDD-X.

Bu Jin, Xinyu Liu, Yupeng Zheng et al.

2023-02-02 82