math.OC 2606.01655

MINTS: Minimalist Thompson Sampling

MINTS achieves optimal solutions for multi-armed bandit problems using a minimalist Bayesian framework, reaching the Lai-Robbins constant.

Kaizheng Wang

2026-06-01 53
cs.MA 2606.01533

Multi-Agent Computer Use

Multi-Agent Computer Use (MACU) improves performance by 3.4-25.5% on desktop and web benchmarks.

Jing Yu Koh, Ruslan Salakhutdinov, Daniel Fried

2026-06-01 16
cs.GT 2606.01275

Domination-Avoiding Learning Agents Cannot Collude

The study proves that 'Domination-Avoiding' learning agents do not collude in markets, including mean-based and internal regret-minimizing algorithms.

Noam Nisan, Emmanuel Zerah

2026-05-31 62
cs.LG 2606.01249

Trust Region On-Policy Distillation

TrOPD employs trust-region strategies and multiple KL estimators to stabilize on-policy distillation, outperforming SOTA with +6.18 performance points.

Xingrun Xing, Haoqing Wang, Boyan Gao et al.

2026-05-31 58