Survive or Collapse: The Asymmetric Roles of Data Gating and Reward Grounding in Self-Play RL

TL;DR

研究发现数据门控是自博弈RL稳定性的关键,奖励信号无法单独解决崩溃问题。

cs.LG 🔴 高级 2026-05-21 34 次浏览
Sophia Xiao Pu Zhaotian Weng Chengzhi Liu Jayanth Srinivasa Gaowen Liu William Yang Wang Xin Eric Wang
自博弈 强化学习 数据门控 奖励设计 稳定性分析

核心发现

方法论

通过在Python输出预测任务和DSL任务上进行实验,研究数据门控和奖励信号对自博弈稳定性的影响。提出了严格数据门控机制和连续门控参数ε,分析了两者的作用。

关键结果

  • 严格数据门控下,无论奖励设计如何,系统均保持稳定;移除门控后,所有奖励设计均导致崩溃。
  • 发现“有地基提议者悖论”:提议者访问真实数据反而加速崩溃。
  • 连续门控参数ε揭示了两阶段相变:训练指标在低ε时解耦,验证准确率在高ε时下降。

研究意义

研究挑战了现有认为奖励设计是解决自博弈崩溃的关键的观点,强调数据质量的重要性。为自博弈RL系统的稳定性提供了新的理论框架,推动了无监督学习的进一步发展。

技术贡献

提出了数据门控作为稳定性约束的新视角,开发了连续门控参数ε以量化门控对系统的影响。通过DSL任务排除环境噪声等干扰因素,验证了优化动态是崩溃的主要原因。

新颖性

首次系统性地分析了数据门控与奖励信号的非对称作用,提出了“有地基提议者悖论”,揭示了提议者与求解器之间的复杂耦合关系。

局限性

  • 研究仅在两个任务上验证,可能无法完全涵盖其他复杂环境。
  • 未考虑提议者生成任务的多样性对系统稳定性的影响。

未来方向

未来可扩展至更复杂的任务环境,研究提议者生成任务的多样性对稳定性的影响,并优化门控机制以提高学习效率。

AI 总览摘要

自博弈强化学习是一种无需人工标注的训练方法,通过提议者生成任务,求解器尝试解决,并根据奖励信号更新策略。然而,这种方法常面临崩溃和不稳定问题,现有研究多关注奖励设计,但忽略了数据质量的影响。

本文通过严格数据门控和连续门控参数ε的实验,发现数据门控是稳定性的关键。即使奖励信号设计完美,缺乏数据门控仍会导致系统崩溃。此外,提出了“有地基提议者悖论”,揭示了提议者访问真实数据反而加速崩溃的现象。

研究结果表明,数据质量比奖励设计更重要,为自博弈RL系统的设计提供了新的思路。未来研究可扩展至更复杂的环境,优化门控机制以进一步提高系统性能。

深度分析

研究背景

自博弈强化学习近年来受到广泛关注,其通过提议者和求解器的协同进化实现无监督学习。代表性工作包括Absolute Zero和其在检索、长上下文推理等领域的扩展。然而,崩溃问题仍是该领域的主要挑战。

核心问题

现有研究认为崩溃问题是奖励设计的缺陷,但忽略了数据质量的影响。提议者生成的任务可能包含噪声或模糊输出,导致求解器无法有效学习。

核心创新

提出了严格数据门控机制,通过过滤提议者生成的任务确保数据质量。引入连续门控参数ε以量化门控对系统稳定性的影响,并揭示了“有地基提议者悖论”。

方法详解

  • �� 在Python输出预测任务和DSL任务上进行实验。
  • �� 实验设计包括严格门控和无门控两种模式,以及连续门控参数ε。
  • �� 分析奖励信号与数据门控的非对称作用,量化崩溃机制。

实验设计

实验使用Python输出预测任务和DSL任务,后者通过去除环境噪声验证优化动态是崩溃的主要原因。对比了不同奖励设计和门控设置的影响。

结果分析

严格门控下系统稳定,无门控时所有奖励设计均崩溃。连续门控参数ε揭示了两阶段相变:训练指标在低ε时解耦,验证准确率在高ε时下降。

应用场景

可用于无监督任务生成系统的设计,例如自动代码生成和复杂逻辑推理任务。适用于需要高数据质量的场景。

局限与展望

实验环境较为简单,未考虑复杂任务的多样性。门控机制可能限制了提议者生成任务的范围,影响系统的长期学习能力。

通俗解读 非专业人士也能看懂

想象一个学校,老师(提议者)出题,学生(求解器)答题并评分。如果老师出的题质量差,学生就会学到错误的知识。研究发现,只要有一个严格的“题目审核员”(数据门控),即使评分机制有问题,学生仍能学得不错;但如果没有审核员,学生很快就会崩溃。

简单解释 像给14岁少年讲一样

想象你和朋友玩一个游戏:你出谜题,他解答。如果你出的谜题太简单或太混乱,他会乱猜,最后大家都觉得游戏没意思。研究发现,只要有一个“谜题检查员”确保谜题质量,游戏就能一直好玩下去!

术语表

数据门控 (Data Gating)

过滤提议者生成的任务以确保数据质量的机制。

用于决定哪些任务进入训练池。

奖励信号 (Reward Signal)

用于更新求解器策略的反馈信号。

包括自一致性奖励和基于执行结果的奖励。

自一致性奖励 (Self-Consistency Reward)

基于求解器内部一致性计算的奖励。

用于评估求解器的答案一致性。

有地基提议者悖论 (Grounded Proposer Paradox)

提议者访问真实数据反而加速系统崩溃的现象。

在无门控设置下观察到。

连续门控参数ε (Continuous Gate Parameter ε)

控制数据门控严格程度的参数。

用于量化门控对系统稳定性的影响。

开放问题 这项研究留下的未解疑问

  • 1 如何在复杂任务环境中扩展数据门控机制?
  • 2 提议者生成任务的多样性如何影响系统稳定性?

应用场景

近期应用

自动代码生成

通过数据门控确保生成代码的质量,提高代码生成系统的可靠性。

逻辑推理任务

应用于需要高数据质量的逻辑推理场景,例如法律分析。

远期愿景

通用无监督学习系统

开发能够在复杂环境中稳定运行的自博弈系统,推动人工智能的长期发展。

原文摘要

Self-play reinforcement learning trains language models on their own generated tasks, co-evolving a proposer and solver without human labels. Recent systems report strong reasoning gains, but collapse and instability are widely observed and poorly understood. The dominant response treats this as a reward-design problem. We argue instead that self-play stability is governed by two distinct levers: a data-level gate that decides which proposer-generated tasks enter the training pool, and the reward signal that updates the policy on tasks already admitted. Through controlled experiments on a Python output-prediction task and a deterministic-DSL twin task that strips pretraining priors, output ambiguity, and executor noise, we find the two levers are asymmetric. A strict gate is sufficient for stability under every reward variant we test, including a self-consistency reward with no access to ground truth; while no reward variant is sufficient once the gate is removed. This asymmetry exposes a counter-intuitive coupling we call the Grounded Proposer Paradox: a proposer with ground-truth access accelerates collapse faster than an ungrounded one when paired with a self-consistency solver, by concentrating training on clean tasks that form the fastest path to a spurious self-consistent attractor. Replacing the binary gate with a continuous strictness parameter $\varepsilon$ further reveals a two-stage phase transition: training-side metrics decouple at low $\varepsilon$, while validation accuracy holds until $\varepsilon$ is much higher. Data-level gating, not reward calibration, is the binding constraint on self-play stability.

cs.LG cs.CL