cs.CL 2607.22043

Scaling Native Multimodal Pre-Training From Scratch

This paper derives power-law scaling laws for from-scratch vision-language pretraining, revealing distinct behaviors for language and multimodal objectives under fixed compute.

Haoyuan Wu, Aoqi Wu, Hai Wang et al.

2026-07-24 55