In-Token Rationality Optimization: Towards Accurate and Concise LLM Reasoning via Self-Feedback
InTRO employs token-level exploration and self-feedback via KL divergence, boosting reasoning accuracy by up to 20% and producing more concise rationales.
Mingye Zhu, Yi Liu, Zheren Fu et al.