Trust Region Policy Optimization
TRPO (Trust Region Policy Optimization) guarantees monotonic policy improvement using KL constraints, excelling in large neural network policy training for robotics and Atari games.
John Schulman, Sergey Levine, Philipp Moritz et al.