BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
BLIP-2 leverages frozen image encoders and large language models via a lightweight Querying Transformer, achieving state-of-the-art zero-shot performance with minimal trainable parameters.
Junnan Li, Dongxu Li, Silvio Savarese et al.