cs.CL 2605.25263

Mimir: Large-scale Multilingual Concept Modeling

Mimir is a 1.6B parameter multilingual concept model trained on 388 billion sentences, shifting from token to concept-level understanding.

Elio Musacchio, Lucia Siciliani, Pierpaolo Basile

2026-05-25 50
cs.CL 2605.22821

Tokenisation via Convex Relaxations

ConvexTok uses convex relaxations to optimize tokenisation, achieving near-optimal compression within 1% at 128k vocabulary, improving BpB significantly.

Jan Tempus, Philip Whittington, Craig W. Schmidt et al.

2026-05-22 457