Preference-Calibrated Human-in-the-Loop Reinforcement Learning for Robotic Manipulation
Proposed PACT framework uses preference signals and task progress modeling to correct overestimated Q-values, boosting success rate by 24.5% and accelerating convergence 1.3× in real robot tasks.
Zeyi Liu, Guangyao Liu, Yinuo Qu et al.