On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting
CHORD framework harmonizes SFT and RL via dynamic weighting, improving LLMs' performance.
Wenhao Zhang, Yuexiang Xie, Yuchang Sun et al.