Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs
Cambrian-1 introduces a vision-centric multimodal large language model (MLLM) leveraging 20+ vision encoders and a novel Spatial Vision Aggregator (SVA), achieving state-of-the-art performance.
Shengbang Tong, Ellis Brown, Penghao Wu et al.