cs.LG 2608.13040

Latent On-Policy Self-Distillation

LOPD introduces learnable latent privileged context, outperforming OPSD variants with less than 30% rollout budget.

Guibin Zhang, Jiayang Lyu, Ran Sun et al.

2026-08-13 69
cs.LG 2608.12564

Scaling Automatic Research Agents via World Models

Introduces WMRL, replacing environment execution with a world model, accelerating AutoResearch agent training 3-4×, surpassing standard RL.

Xiyuan Yang, Sheikh Sarwar, Jingru Cheng et al.

2026-08-13 55