cs.CV 2307.12732

CLIP-KD: An Empirical Study of CLIP Model Distillation

CLIP-KD employs feature alignment and contrastive learning to improve small models, maximizing similarity with teacher features, achieving significant performance gains.

Chuanguang Yang, Zhulin An, Libo Huang et al.

2023-07-24 32
cs.CV 2307.05663

Objaverse-XL: A Universe of 10M+ 3D Objects

Objaverse-XL, with over 10 million 3D models, significantly advances large-scale 3D vision tasks.

Matt Deitke, Ruoshi Liu, Matthew Wallingford et al.

2023-07-12 36
cs.CV 2307.04087

SVIT: Scaling up Visual Instruction Tuning

SVIT introduces a 4.2M high-quality visual instruction dataset, significantly outperforming state-of-the-art multimodal models.

Bo Zhao, Boya Wu, Muyang He et al.

2023-07-09 34
cs.CV 2306.14899

FunQA: Towards Surprising Video Comprehension

FunQA enhances VLM understanding of counter-intuitive videos via multi-turn dialogues, featuring 312K QA pairs.

Binzhu Xie, Sicheng Zhang, Zitang Zhou et al.

2023-06-27 4