Global linear convergence of entropy-regularized softmax policy gradient beyond tabular MDPs
Establishes global linear convergence of entropy-regularized softmax policy gradient in continuous-space MDPs via non-uniform Polyak-Łojasiewicz inequality, extending beyond tabular cases.
Ziyue Chen, David Šiška, Lukasz Szpruch