cs.CV 2605.25427

Binding Visual Features Point by Point

Point-via-text method resolves binding problem in vision language models, enhancing multi-object task performance.

Udith Haputhanthri, Declan Campbell, Rim Assouel et al.

2026-05-25 4
cs.CL 2605.25263

Mimir: Large-scale Multilingual Concept Modeling

Mimir is a 1.6B parameter multilingual concept model trained on 388 billion sentences, shifting from token to concept-level understanding.

Elio Musacchio, Lucia Siciliani, Pierpaolo Basile

2026-05-25 56