cs.CL 2606.23566

LangMAP: A Language-Adaptive Approach to Tokenization

LangMAP extends UnigramLM with language-specific MAP estimation, enabling multi-language tokenization from a shared vocabulary, improving morphological boundary alignment.

Clara Meister, Suchir Salhan, Andrzej Szablewski et al.

2026-06-23 229
cs.CL 2606.19336

Learning User Simulators with Turing Rewards

Proposes Turing-RL, a reinforcement learning approach using discriminative Turing rewards to train human user simulators, outperforming traditional response matching methods.

Yingshan Susan Wang, Cedegao E. Zhang, Linlu Qiu et al.

2026-06-18 204