cs.GT 2606.01275

Domination-Avoiding Learning Agents Cannot Collude

The study proves that 'Domination-Avoiding' learning agents do not collude in markets, including mean-based and internal regret-minimizing algorithms.

Noam Nisan, Emmanuel Zerah

2026-05-31 62
cs.LG 2606.01249

Trust Region On-Policy Distillation

TrOPD employs trust-region strategies and multiple KL estimators to stabilize on-policy distillation, outperforming SOTA with +6.18 performance points.

Xingrun Xing, Haoqing Wang, Boyan Gao et al.

2026-05-31 58