Exploration-Driven Optimization for Test-Time Large Language Model Reasoning
Proposes Exploration-Driven Optimization (EDO) to enhance diversity and reasoning in LLMs by reward biasing integrated into iterative RL methods.
Changhao Li, Yuchen Zhuang, Chenxiao Gao et al.