REVES: REvision and VErification--Augmented Training for Test-Time Scaling

TL;DR

REVES通过两阶段迭代框架优化测试时修正能力,提升+6.5分,适用于多任务和推理。

cs.LG 🔴 高级 2026-06-17 46 次浏览
Yuanxin Liu Ruida Zhou Xinyan Zhao Amr Sharaf Hongzhou Lin Arijit Biswas Mohammad Ghavamzadeh Zhaoran Wang Mingyi Hong
大规模语言模型 测试时修正 强化学习 训练优化 多任务推理

核心发现

方法论

REVES采用两阶段策略:第一阶段通过在线数据增强,利用模型在成功修正轨迹中生成的中间“近失误”答案,转化为解答修正和验证提示;第二阶段利用单轮强化学习对增强数据进行训练,避免长序列采样的高成本。该方法通过分解测试时修正目标JϕSR为单步恢复概率,有效提升模型修正能力。实验中,REVES在LiveCodeBench上超越RL基线6.5分,优于传统多轮RL4.0分,并在圆包问题中以4B模型达到SOTA,验证了其在数学推理和约束满足任务中的优越性。

关键结果

  • 在LiveCodeBench上,REVES比RL基线提升6.5点,超越多轮训练4.0点,表现出显著的性能增强。
  • 在圆包任务中,REVES用4B模型匹配大型演化搜索系统的最优结果,表明其在复杂几何优化中的潜力。
  • 在数学和编码任务中,REVES在ground-truth验证和自信停止下均表现出优异的纠错能力,显著优于传统方法。

研究意义

该研究突破了传统单次优化的局限,通过引入基于中间状态的逐步修正策略,有效对齐模型训练目标与测试时推理动态,推动大模型在复杂推理和约束满足任务中的应用。其提出的分解策略和离线增强机制,为未来模型在多轮交互和复杂任务中的修正能力提供了理论基础和工程方案,具有深远的学术和产业价值。

技术贡献

创新点在于将测试时修正转化为单步恢复概率的分解,提出REVES框架,结合离线数据增强和单轮RL训练,避免长序列采样的高成本。理论上,证明了提升单步修正能力可转移至多轮修正性能,提供了明确的优化目标。工程上,设计了高效的离线增强流程和验证机制,显著提升训练效率和模型修正能力,超越现有多轮RL和演化搜索方法。

新颖性

首次将测试时修正问题形式化为分解的单步恢复概率,提出离线增强与单轮RL结合的双阶段训练策略,有效解决多轮RL中的路径偏差和高成本问题,显著提升模型修正能力和泛化性。

局限性

  • 方法依赖于成功轨迹的筛选,可能在基础模型性能较差时效果有限,且对验证机制的依赖增加了实际部署的复杂性。
  • 在极端复杂或未见任务中,模型的修正能力仍受限于训练数据的覆盖范围和增强策略的效果。
  • 训练过程中对中间状态的采样和筛选可能引入偏差,影响最终性能,未来需优化样本效率和泛化能力。

未来方向

未来可结合多模态信息和更复杂的验证机制,扩展REVES到更广泛的推理和规划任务。同时,探索自监督和元学习结合的训练策略,以进一步提升模型的修正和验证能力,推动大模型在实际复杂场景中的应用落地。

AI 总览摘要

REVES提出了一种创新的测试时训练优化框架,旨在增强大规模语言模型的多轮修正能力。传统方法多关注单次目标优化,难以对齐多步推理的动态需求。本文通过将中间“近失误”答案转化为解答修正和验证提示,利用离线数据增强和单轮强化学习,有效提升模型在复杂推理和约束任务中的表现。

该方法的核心在于将测试时修正目标JϕSR分解为单步恢复概率,从而避开长序列采样的高成本和路径偏差问题。实验结果显示,REVES在LiveCodeBench上超越基线6.5分,优于传统多轮RL4.0分,并在圆包任务中以4B模型达到SOTA水平,验证了其在几何优化和数学推理中的优越性。

此外,REVES在多种数学和编码任务中表现出强大的纠错和泛化能力,尤其在ground-truth验证和自信停止策略下,表现优异。该研究不仅为大模型的修正能力提供了理论基础,也为未来多轮交互和复杂任务的训练策略开辟了新路径,具有重要的学术和产业价值。

未来,结合多模态信息和元学习技术,REVES有望在更广泛的推理、规划和决策任务中实现突破,推动大模型在实际应用中的广泛部署。

深度分析

研究背景

近年来,大规模语言模型(如GPT、PaLM)在自然语言理解和生成任务中取得突破,但其在复杂推理、多步交互和约束满足任务中的表现仍有限。传统训练多依赖单次目标优化(如RLHF),难以充分捕捉多轮推理的动态特性。近年来,测试时修正(Test-Time Scaling)策略如序列修正(SR)、树搜索、演化优化等逐渐兴起,试图通过多轮交互提升模型性能。尽管如此,现有方法多关注轨迹级别的奖励,存在路径偏差和采样成本高的问题。学界开始探索将修正能力作为训练目标,结合强化学习和监督学习,提升模型的修正和验证能力,但仍缺乏系统性框架解决多轮修正的效率和效果问题。

核心问题

核心问题在于如何设计一种训练策略,使模型在测试时能高效、准确地进行多轮修正。现有方法多采用轨迹级奖励,容易受到路径偏差影响,且训练成本高。如何在保证训练效率的同时,显著提升模型的逐步修正能力,成为亟待解决的难题。此外,如何将中间“近失误”状态转化为有效的训练信号,也是提升模型修正能力的关键。

核心创新

本文提出REVES框架,创新点包括:1)将测试时修正目标分解为单步恢复概率,明确每个状态的修正能力;2)利用离线数据增强,将中间“近失误”答案转化为解答修正和验证提示,避免长序列采样;3)引入双阶段训练:第一阶段采样成功轨迹,生成增强数据;第二阶段用单轮RL训练模型,提升局部修正能力。这一策略有效解决路径偏差和采样成本问题,显著提升模型修正能力和泛化性。

方法详解

  • �� 通过运行当前策略在训练集上采样成功轨迹,筛选出在预算内成功的轨迹,提取中间状态。
  • �� 将中间状态转化为解答修正提示和验证提示,构建增强数据集。
  • �� 在第二阶段,利用单轮RL在增强数据上训练模型,优化单步修正能力。
  • �� 采用离线方式生成和筛选样本,避免在线长序列采样带来的高成本。
  • �� 设计验证机制,允许模型在测试中自我停止,提升实际应用的鲁棒性。

实验设计

在LiveCodeBench、数学推理(MATH500、AIME24/25)和几何优化(圆包)等多个任务上,采用不同模型(如Qwen3-4B、Qwen2.5-7B)进行训练和评估。比较基线包括RL、传统多轮RL和自验证方法。指标涵盖准确率、修正成功率和任务特定的性能指标。实验还包括不同预算和停止策略的对比,验证REVES在提升修正能力和泛化能力方面的有效性。

结果分析

REVES在LiveCodeBench上超越RL基线6.5分,在圆包任务中用4B模型达到SOTA,表现优于大型演化搜索系统。在数学推理任务中,提升修正成功率显著,尤其在ground-truth验证和自信停止下表现优异。多任务评估显示,REVES具有良好的泛化能力,能有效应对未见任务和约束满足问题,验证了其在复杂推理场景中的潜力。

应用场景

该方法适用于需要多轮交互修正的场景,如代码生成、数学推理、规划和决策支持。模型可在部署时自主判断是否修正,减少人工干预,提高自动化水平。未来可结合多模态信息和强化学习技术,拓展到更复杂的任务和实际应用中,推动大模型在工业界的落地。

局限与展望

当前方法依赖成功轨迹的筛选,可能在基础模型性能不足时效果有限。对验证机制的依赖增加了系统复杂性。训练过程中样本筛选和增强可能引入偏差,影响泛化能力。未来需优化样本效率,扩展到更复杂和多模态任务,解决在极端场景下的适应性问题。

通俗解读 非专业人士也能看懂

想象你在厨房里做菜,遇到一道复杂菜谱,第一次尝试可能做得不完美。每次失败后,你会总结经验,调整调料和步骤,再试一次。REVES就像是教厨师不断学习和改进的系统,它通过分析每次失败的原因,改进下一次的做法。它不是只看一次结果,而是不断从中间的“失误”中学习,逐步变得更擅长做出完美的菜。这种方法让厨师(模型)在面对新菜谱时,也能不断修正,最终做出令人满意的菜肴。

简单解释 像给14岁少年讲一样

想象你在学校做科学实验,第一次可能做得不太对,但你会仔细观察哪里出了错,然后改正,再试一次。REVES就像是一个聪明的老师,它会帮你分析每次实验的中间步骤,找出错误的地方,告诉你怎么改。每次你修正后,它会让你再试一次,直到你做出正确的结果。这样,你就能不断学习,变得越来越擅长做科学实验。这个方法让模型也能像你一样,通过不断修正错误,变得更聪明、更厉害。

术语表

Test-Time Scaling (测试时扩展)

在模型部署时,通过额外的修正和验证步骤提升模型性能的策略;在论文中指利用多轮修正增强模型推理能力。

REVES的核心思想是通过测试时的多轮修正实现性能提升。

Sequential Revision (序列修正)

模型在多轮交互中,根据反馈逐步修正答案的策略;是本文优化的主要目标。

本文提出的REVES框架专注于提升序列修正能力。

单步恢复概率 (One-step Recovery Probability)

在某一状态下,模型成功修正到正确答案的概率;用于分解测试目标,指导训练。

通过优化单步恢复概率,提升模型整体修正能力。

离线数据增强 (Offline Data Augmentation)

在训练过程中预先生成和筛选训练样本,避免在线长序列采样的高成本。

REVES利用离线增强提升训练效率和效果。

Verifiable Reward (可验证奖励)

在训练和测试中,利用可计算的指标(如测试用例通过情况)作为奖励信号。

论文中在数学和编码任务中采用此机制。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升模型在极端复杂任务中的修正能力,仍需探索更高效的样本采样和验证机制。
  • 2 在多模态和多任务环境下,REVES的适应性和扩展性仍待验证。

应用场景

近期应用

代码自动修正

利用REVES提升AI在代码生成中的修正能力,减少错误率,增强自动调试和优化效率。

数学推理增强

在数学题解和证明中应用REVES,提升模型的推理准确率,减少错误和遗漏。

远期愿景

智能决策系统

未来可将REVES应用于复杂决策和规划系统,让AI自主修正偏差,提升可靠性和自主性。

原文摘要

Test-time scaling via sequential revision has emerged as a powerful paradigm for enhancing Large Language Model (LLM) reasoning. However, standard post-training methods primarily optimize single-shot objectives, creating a fundamental misalignment with multi-step inference dynamics. While recent work treats this as multi-turn reinforcement learning (RL), conventional approaches optimize over the multi-step trajectories directly, failing to further exploit the high-quality mistakes in intermediate steps that model can learn from correcting them. We propose a two-stage iterative framework that alternates between online data/prompt augmentation and policy optimization. By converting the intermediate steps (``near-miss'' answers) in the successful recovery trajectories into decoupled revision and verification prompts, our approach concentrates training on both effective answer transformation and error identification. This approach enables efficient off-policy data generation and reduces the computational overhead of long-horizon sampling compared to standard multi-turn RL. On LiveCodeBench, using publicly available test cases as feedback, we observe gains of +6.5 points over the RL baseline and +4.0 points over standard multi-turn training. Beyond coding, our approach matches the previously reported SOTA result on circle packing while using the smallest base model (4B) and far fewer rollouts than the much larger evolutionary search systems. Math results under ground-truth verification further confirm improved correction ability. It also generalizes to out-of-distribution constraint-satisfaction puzzles such as n\_queens and mini\_sudoku, where correctness is defined entirely by problem constraints. Code is available at https://github.com/yxliu02/REVES.git.

cs.LG cs.CL