Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning
Q-Planning integrates a frozen behavior cloning policy with a small off-policy Q-function, enabling stable self-improvement and success rates up to 99%.
Varun Giridhar, Anant Khandelwal, Jeremy A. Collins et al.