Does Context Matter? ContextualJudgeBench for Evaluating LLM-based Judges in Contextual Settings
Introduces ContextualJudgeBench benchmark, evaluating LLM judges' performance in contextual settings, with top accuracy only reaching 55%.
Austin Xu, Srijan Bansal, Yifei Ming et al.