cs.CV 2303.09295

DIRE for Diffusion-Generated Image Detection

Proposes DIRE, leveraging diffusion model reconstruction error for high-accuracy detection of diffusion-generated images, outperforming existing methods.

Zhendong Wang, Jianmin Bao, Wengang Zhou et al.

2023-03-16 44
cs.CL 2303.08774

GPT-4 Technical Report

GPT-4 is a multimodal Transformer trained with predictive and RLHF methods, achieving human-level performance and scalable predictability.

OpenAI, Josh Achiam, Steven Adler et al.

2023-03-16 36
cs.CV 2303.07677

SR-init: An interpretable layer pruning method

SR-init assesses layer redundancy by measuring accuracy drop after stochastic re-initialization, enabling interpretable pruning with significant parameter reduction.

Hui Tang, Yao Lu, Qi Xuan

2023-03-14 38
cs.CV 2303.07280

Vision-Language Models as Success Detectors

Using Flamingo as a success detector framed as VQA, achieving cross-domain generalization with minimal human annotations.

Yuqing Du, Ksenia Konyushkova, Misha Denil et al.

2023-03-14 42
cs.CV 2303.05511

Scaling up GANs for Text-to-Image Synthesis

GigaGAN introduces a new architecture for text-to-image synthesis, generating 512px images in just 0.13 seconds.

Minguk Kang, Jun-Yan Zhu, Richard Zhang et al.

2023-03-10 34