Same Trajectory, Contradictory Rewards (ROBORMBENCH): Paraphrase Fragility in Vision Language Reward Models
ROBORMBENCH reveals reward instability in vision-language models under semantically equivalent instructions, featuring 2,390 trajectories and 21,673 paraphrases.
Wonje Jeung, Sangyeon Yoon, Hyesoo Hong et al.