核心发现
方法论
本文提出的CoRE方法将模型在无标签测试数据上的多次采样轨迹构建成图,边权结合答案一致性、推理相似性和生成置信度。利用复制者动力学(replicator dynamics)提取图中的主导集,生成细化的伪标签、逐轨奖励和问题级凝聚门控。该方法严格推广投票机制,包含多数投票作为特例。通过块值分析确定在何种条件下少数正确支持可以逆转多数错误,置信度校准则指数级降低阈值。实验在七种模型架构和五个基准上验证,平均提升21.7点,优于传统多数投票的20.4点,且在争议较大时表现更优,减少54-70%的训练步骤。
关键结果
- 在42个模型-基准组合中,CoRE平均提升21.7分,优于多数投票的20.4分,表现出在争议场景中的优势,最高提升达7.5分。
- 在数学和推理任务中,CoRE在多个模型上均实现显著性能提升,尤其在难度较高的样本中表现优越,缩短训练时间达54-70%。
- 消融实验显示,图结构和置信度校准的结合是性能提升的关键,单独使用难以超越投票机制。
研究意义
该研究突破了传统投票式奖励的局限,将模型轨迹关系转化为图结构,利用动力学提取共识,显著提升无标签测试强化学习的效果。此方法为模型自监督提供了新的思路,兼顾模型的推理一致性和置信度校准,有望推动大规模语言模型在无监督环境中的性能提升,特别是在复杂推理和少数支持场景中。其理论分析和实证验证为未来模型融合与自监督策略提供了理论基础,具有重要学术和应用价值。
技术贡献
本文首次将复制者动力学应用于强化学习奖励设计,通过图结构和块值分析实现多轨迹的共识提取,超越传统投票机制。提出的CoRE框架融合答案一致性、推理相似性和置信度,提供逐轨奖励和问题级门控,理论上严格推广投票,分析了在何种条件下少数正确支持可逆转多数错误。该方法无需额外标注或模型,能在多模型、多任务环境中实现自适应优化,增强模型的推理稳健性和自监督能力。
新颖性
本研究首次将图结构和复制者动力学引入测试时强化学习奖励设计,超越传统投票机制,提出细粒度的逐轨奖励和共识提取策略。不同于以往仅依赖投票或置信度加权,CoRE结合多源信息,提供理论阈值分析,显著改善少数正确支持的恢复能力,具有创新性和前沿性。
局限性
- 该方法依赖置信度校准的准确性,在模型过度自信或置信度偏差时可能失效,导致共识提取不稳定。
- 图结构的构建和复制者动力学计算复杂度较高,尤其在大规模轨迹集时可能影响效率。
- 在极端不平衡或噪声较多的场景中,少数支持的恢复能力有限,仍需结合其他策略优化。
未来方向
未来可结合更高效的图构建与优化算法,提升大规模场景下的实时性。还可探索多模态、多任务环境中共识机制的扩展,结合强化学习与自监督的多源信息融合,增强模型在复杂环境中的稳健性。此外,理论分析可进一步细化,指导实际应用中的参数调优和模型设计。
AI 总览摘要
在当今自然语言处理领域,模型在无标签测试数据上的推理能力仍面临巨大挑战。传统的测试时强化学习(TTRL)多依赖多数投票作为伪标签,然而这一策略在存在少数正确支持但被多数错误淹没的情况下表现不佳。本文提出的CoRE(Consensus Rewards via Equilibrium)创新性地将轨迹关系转化为图结构,利用复制者动力学(replicator dynamics)提取最具支持性的轨迹集合,从而生成更精细的伪标签和逐轨奖励。该方法在理论上严格推广了投票机制,分析了在何种条件下少数正确支持可以逆转多数错误,置信度校准则指数级降低阈值。实验证明,在七种模型架构和五个基准任务中,CoRE平均提升21.7分,优于传统多数投票的20.4分,尤其在争议激烈的场景中表现出明显优势,减少了54-70%的训练步骤。这一创新不仅增强了模型的推理稳健性,也为无监督环境下的模型自监督提供了新思路。未来,结合更高效的图优化算法和多模态信息融合,CoRE有望在更大规模和更复杂的任务中发挥关键作用,推动大规模语言模型的自我学习能力迈上新台阶。
深度分析
研究背景
近年来,随着大规模预训练模型的发展,模型推理能力不断提升,但在无标签环境下的自监督学习仍是难点。早期方法如自我一致性(Self-Consistency)和置信度加权投票(CISC)在提升推理准确性方面取得一定成效,但存在对少数支持的忽视和投票机制的脆弱性。测试时强化学习(TTRL)通过采样轨迹并用多数投票生成伪标签,已成为主流,但其局限在于多数错误时会误导模型。近年来,图结构和群体动力学的引入为模型融合提供新思路,激发了对多轨迹关系建模的探索。
核心问题
现有的TTRL多依赖简单的多数投票,忽视了轨迹之间的关系和推理的支持度,导致在少数正确支持被淹没时性能下降。投票机制的二元性质无法区分支持强弱,也无法利用模型在生成过程中的置信度信息,限制了奖励信号的细粒度表达。这在复杂推理任务和少数支持场景中尤为明显,亟需一种更具表达力的机制来提取轨迹间的共识。
核心创新
本文提出的核心创新包括:1)将轨迹构建成图,边权结合答案一致性、推理相似性和生成置信度;2)引入复制者动力学,从图中提取主导集,生成细粒度奖励和伪标签;3)理论分析阐明在何种条件下少数支持可以逆转多数错误,置信度校准指数级降低阈值。这些创新突破了传统投票的局限,提供了多源信息融合的理论基础,显著提升少数支持的恢复能力。
方法详解
- �� 构建轨迹图:模型采样N个轨迹,节点代表轨迹,边权结合答案一致性(Kans)、推理相似性(Krsn)和置信度(ci)。
- �� 归一化边权:根据置信度校准边权,确保高置信度轨迹对共识的贡献更大。
- �� 复制者动力学:从图的邻接矩阵出发,初始化均匀分布,迭代更新轨迹支持度,提取最大支持集。
- �� 伪标签与奖励:用主导集中的答案作为伪标签,轨迹的支持度作为逐轨奖励,问题级凝聚门控调节整体训练强度。
- �� 理论分析:通过块值分析,推导出支持逆转的阈值,置信度校准指数级降低该阈值,确保少数正确支持的恢复。
实验设计
在AMC、AIME 2024、MATH-500及其子集,以及GPQA-Diamond等五个数学和推理任务上,采用七种不同预训练模型(如Qwen、Llama、Mistral)进行测试。每个模型采样64个轨迹,利用不同奖励策略(投票、EC、CISC、CoRE)进行训练,评估其在不同采样数和训练步骤下的性能。采用平均准确率作为指标,比较不同方法的提升幅度,特别关注争议场景中的表现。实验还包括消融分析,验证图结构和置信度校准的贡献。
结果分析
结果显示,CoRE在所有模型和任务中均优于传统投票,平均提升21.7分,最高在争议场景中达7.5分。在训练步骤方面,CoRE能在54-70%更少的步骤内达到投票的最终准确率,验证其训练效率和稳健性。消融实验表明,单独使用图结构或置信度校准难以超越投票,二者结合才实现显著性能提升。这些结果验证了理论分析的预测,显示了少数支持的恢复能力。
应用场景
该方法适用于大规模语言模型的无监督微调、推理增强和模型自监督训练。特别在复杂推理、少数支持场景和少标签环境中,可显著提升模型的稳健性和准确性。未来还可结合多模态信息和图优化算法,拓展到多任务、多模态场景,推动模型在实际应用中的自主学习和推理能力。
局限与展望
当前方法依赖置信度的准确性,模型过度自信或偏差会影响共识提取效果。图结构构建和动力学计算复杂度较高,难以在超大规模轨迹集上实时应用。极端不平衡或噪声较多的场景下,少数支持的恢复能力仍有限,未来需优化算法效率和鲁棒性。
通俗解读 非专业人士也能看懂
想象你在厨房做饭,有很多不同的厨师(模型轨迹)在尝试做一道菜。有的厨师用不同的方法,但都试图做出一样的菜。有时候,大多数厨师都用一种方法,但偶尔会有少数厨师用不同的办法,他们可能做得更好。传统的方法就像让所有厨师投票,选择最多厨师的方法,但如果少数厨师的方案更好,就会被忽略。CoRE就像请一位厨艺专家(复制者动力学)观察所有厨师的表现,找出那些互相支持、共同认可的厨师团队,从而识别出真正的好方案。这样,即使少数厨师的方案很棒,也能被发现。这个方法让厨房里的“投票”变得更聪明、更公平,不仅能找到更好的菜,还能节省时间。它让我们相信,合作和关系比简单的投票更重要。
原文摘要
On unlabeled test data, reinforcement learning lacks a ground-truth reward; test-time RL methods derive one from the model's own roll-outs, rewarding those that match the majority vote over $N$ sampled answers. That vote discards a correct answer whenever it is a minority and scores every majority-matching roll-out identically. We replace it with \emph{CoRE} (Consensus Rewards via Equilibrium): the $N$ roll-outs form a graph whose edges combine answer agreement, reasoning similarity, and generation confidence, and replicator dynamics extract its dominant set, yielding a refined pseudo-label, a graded per-roll-out reward, and a per-question cohesiveness gate. CoRE strictly generalizes voting: majority voting is recovered as a special case; a block-value analysis gives a sharp threshold for when consensus recovers a correct minority against a larger wrong plurality; and confidence calibration provably lowers that threshold multiplicatively. Across seven backbones and five benchmarks (42 model--benchmark cells, three seeds each), \emph{CoRE} improves the untrained base by $+21.7$ points on average versus $+20.4$ for majority-vote TTRL, wins wherever agreement is contestable with margins over the vote of up to $+7.5$ points, and reaches the voting baseline's plateau accuracy in $54$--$70$\% fewer steps. Consensus, not counting: treating the roll-out group as a graph rather than a ballot box turns a brittle vote into a calibrated, graded, self-supervised reward at no extra roll-out cost.