Learning User Simulators with Turing Rewards
Proposes Turing-RL, a reinforcement learning approach using discriminative Turing rewards to train human user simulators, outperforming traditional response matching methods.
Yingshan Susan Wang, Cedegao E. Zhang, Linlu Qiu et al.