Optimal Transport for LLM Reward Modeling from Noisy Preference
Proposes SelectivelyRM, an optimal transport-based framework for robust reward modeling from noisy preferences, outperforming SOTA by 5-10% in error metrics.
Licheng Pan, Haochen Yang, Haoxuan Li et al.