FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI
FrontierMath benchmark tests advanced mathematical reasoning; AI solves less than 2%, exposing a large gap with human experts.
Elliot Glazer, Ege Erdil, Tamay Besiroglu et al.