cs.CL 2511.03237

MUTANT: A Recipe for Multilingual Tokenizer Design

MUTANT employs a two-stage BPE training with language-aware preprocessing, reducing fertility by 39.5%, boosting inference throughput by 44%.

Souvik Rana, Arul Menezes, Ashish Kulkarni et al.

2025-11-05 48
cs.CL 2510.25160

Model-Document Protocol for AI Search

MDP-Agent enhances AI search by transforming documents into LLM-ready inputs, achieving 35% accuracy improvement.

Hongjin Qian, Zheng Liu

2025-10-29 47