HindSearch: Trajectory-Level Hindsight Critique for Search-Augmented Reinforcement Learning
HindSearch introduces trajectory-level hindsight critique with on-policy distillation, boosting average EM to 39.4% on seven QA benchmarks, outperforming prior methods.
Haowei Liu, Jiamian Wang, Hsin-Tai Wu et al.