Confronting Reward Model Overoptimization with Constrained RLHF
Proposes constrained RLHF to prevent reward model overoptimization by dynamically regulating component weights via Lagrange multipliers, improving evaluation stability.
Ted Moskovitz, Aaditya K. Singh, DJ Strouse et al.