cs.LG 2608.18669

Reinforced Planning with Latent World Models

RP1 learns multi-step plan improvement rules via reinforcement, achieving near-perfect success with 1/1000 model rollouts and 67× faster inference in robotic tasks.

Armin Sommer, Jannik Schilling

2026-08-19 51