ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models
ALLaVA uses GPT-4V to generate 1.3M high-quality vision-language samples, enabling lightweight models to match large-scale model performance.
Guiming Hardy Chen, Shunian Chen, Ruifei Zhang et al.