Scaling Automatic Research Agents via World Models

TL;DR

提出WMRL,通过世界模型替代环境执行,提升自动研究代理训练速度3-4倍,超越标准RL。

cs.LG 🔴 高级 2026-08-13 52 次浏览
Xiyuan Yang Sheikh Sarwar Jingru Cheng Zhan Shi Duanshun Li Huiyuan Chen Haiyang Zhang Chenlei Guo Jingrui He Zhenyu Liao
强化学习 世界模型 自动研究 算法优化 深度学习

核心发现

方法论

本文引入世界模型RL(WMRL),用训练好的语言模型模拟环境,替代昂贵的环境执行。通过在训练中结合在线去偏和逆方差去噪机制,有效缓解模型偏差与噪声带来的收敛误差。利用anchor信号实时校正偏差,融合多源奖励以降低噪声,理论上证明两机制均严格改善收敛保证。实验证明WMRL在多任务、多尺度下加速训练3-4倍,且超越传统RL基线,4B和9B规模的代理在公开基准中优于更大模型。

关键结果

  • WMRL在多项自动研究任务中实现训练速度提升3-4倍,显著降低训练成本。4B和9B模型在未见任务上超越48B和120B模型的表现,提升了样本效率和泛化能力。
  • 引入偏差校正和去噪机制后,训练性能与使用真实环境奖励相当甚至更优,验证了理论分析中的收敛保证增强。
  • WMRL成功迁移到VLA(视觉-语言-动作)后训练,展示了方法的广泛适用性和潜在的工业应用前景。

研究意义

该研究突破了强化学习在自动研究中的环境执行瓶颈,提出利用世界模型实现高效模拟,极大提升训练效率,降低硬件成本。其理论保证和实证验证为未来大规模自主研究代理的设计提供了新思路,有望推动自动化科学发现、软件工程等多个领域的创新发展。

技术贡献

创新点在于结合世界模型与强化学习,提出偏差校正与去噪机制,严格理论分析保证收敛性。引入anchor信号实现在线校正,融合多源奖励降低噪声,系统性解决环境模拟不完美带来的误差。同时,模型可迁移到后训练的 embodied 策略,拓展了方法的适用范围。

新颖性

首次系统性将世界模型引入AutoResearch的RL训练中,结合偏差校正与逆方差去噪,提出理论上严格的收敛保证。区别于传统纯粹环境模拟或离线奖励学习,强调在线校正与多源融合,显著提升训练效率与效果。

局限性

  • 依赖少量真实环境数据进行偏差校正,若环境变化剧烈或偏差难以建模,效果可能受限。
  • 模型训练和推理仍需较大计算资源,尤其在高维任务中可能面临性能瓶颈。
  • 在极端随机性或复杂环境中,世界模型的预测误差可能影响最终性能。

未来方向

未来将探索更强大的环境模拟模型,提升偏差校正的鲁棒性,并结合多模态信息增强模拟精度。此外,将方法推广到更复杂的自主系统和多任务场景,优化模型训练与推理的效率,推动自动研究代理的规模化应用。

AI 总览摘要

自动研究(AutoResearch)旨在让AI自主进行科学实验与探索,已在化学合成、科学发现、机器学习等领域展现潜力。然而,现有RL训练中环境执行成本极高,成为规模化瓶颈。本文提出世界模型RL(WMRL),用训练好的语言模型模拟环境,替代昂贵的实际执行,大幅提升训练速度。通过引入偏差校正(Online Debiasing)和逆方差去噪(Inverse-Variance Denoising)机制,有效缓解模型不完美带来的误差,理论上保证收敛性。实验证明,WMRL在多任务、多尺度下加速训练3-4倍,超越传统RL基线,4B和9B模型在公开基准中优于更大模型。该方法不仅降低了硬件成本,也为未来大规模自主研究代理提供了新思路。其迁移能力到视觉-语言-动作任务,展示了广泛的适用性。未来,结合更强的模拟模型和多模态信息,将推动自动研究的规模化和智能化发展,为科学和工业带来深远影响。

深度分析

研究背景

近年来,自动研究(AutoResearch)逐渐成为AI领域的热点,旨在实现AI自主进行科学实验和创新。早期工作如AlphaFold在蛋白质结构预测、ChemAI在化学反应设计,以及ML解决方案自动生成,推动了自动化科研的快速发展。深度学习模型,尤其是大规模预训练语言模型(如GPT系列),在自动化方案生成中表现出色。强化学习(RL)作为优化策略的核心,广泛应用于自动实验设计、数据采集与分析中。然而,训练这些代理面临巨大挑战,尤其是环境执行成本高昂,限制了规模和效率。现有方法多依赖大量真实环境交互,导致训练成本高、速度慢,难以实现大规模自主科研。

核心问题

核心问题在于,自动研究代理的训练依赖于环境执行以获得奖励,环境模拟耗费大量计算资源,成为瓶颈。生成部分可以通过批处理实现高效,但环境执行必须在隔离沙箱中逐一运行,成本线性增长,严重限制了训练规模。如何在保证训练效果的同时,降低环境执行成本,成为亟待解决的难题。此外,现有的环境模拟模型存在偏差和噪声,影响奖励的准确性,进一步制约训练效果。

核心创新

本文提出WMRL,利用预训练的语言模型作为世界模型,模拟环境输出,替代昂贵的实际执行。引入偏差校正(Online Debiasing)机制,实时校准模型偏差,确保奖励的真实性。结合逆方差去噪(Inverse-Variance Denoising),融合多源奖励,降低噪声影响。理论上,证明两机制严格改善收敛保证。方法可迁移到后训练的 embodied 策略,拓展应用范围。创新点在于系统性结合模型模拟、偏差校正和多源融合,突破环境瓶颈,提升训练效率。

方法详解

  • �� 采用预训练语言模型作为环境模拟器,输入任务上下文和方案,输出预测结果,替代实际环境执行。• 利用少量真实环境交互(anchor信号)校正模型偏差,采用单调回归(如等距回归)进行偏差校正。• 通过融合真实奖励与模型预测奖励,采用逆方差加权策略,降低噪声影响。• 设计理论分析,量化偏差和噪声对收敛的影响,证明两机制能严格改善收敛保证。• 在训练过程中动态调整融合比例,确保模型在偏差和噪声之间取得平衡。• 结合多任务、多尺度实验验证方法的有效性,分析不同偏差和噪声水平下的性能表现。

实验设计

在多个AutoResearch任务(如Kaggle竞赛、数据科学任务)和VLA(视觉-语言-动作)任务上进行验证。采用不同规模(4B、9B)模型,比较传统RL、纯模型模拟和WMRL的训练速度与性能。指标包括任务得分(百分位排名)和训练时间。设置对比实验,包括无校正、单一机制和两机制结合,分析其对收敛速度和最终效果的影响。超参数包括anchor比例、偏差校正频率和融合权重。采用标准硬件(A100 GPU)进行训练,确保公平性。

结果分析

WMRL在多项任务中实现训练速度提升3-4倍,显著降低硬件成本。4B和9B模型在未见任务上的表现优于更大模型(如48B、120B),提升样本效率。引入偏差校正和去噪机制后,模型性能与使用真实环境奖励相当甚至更优,验证了理论分析。迁移到VLA任务中,效果同样优异,展示了方法的广泛适用性。 Ablation研究显示,两机制的结合优于单一机制,验证其协同作用。

应用场景

该方法适用于科学研究、软件工程、自动化设计等领域,尤其在环境模拟成本高昂或难以实现的场景。可用于加速药物设计、材料探索、机器人策略训练等。通过减少对真实环境的依赖,降低硬件成本,提高训练效率,推动自主系统的规模化应用。未来还可结合多模态信息,增强模拟模型的准确性,拓展到更复杂的任务。

局限与展望

依赖少量真实环境数据进行偏差校正,若环境变化剧烈或偏差难以建模,效果可能受限。模型训练和推理仍需较大计算资源,尤其在高维任务中可能面临性能瓶颈。模型预测误差在极端随机或复杂环境中可能影响最终性能。未来需提升模拟模型的鲁棒性和泛化能力,减少对真实交互的依赖。

通俗解读 非专业人士也能看懂

想象你在一家厨房做菜,传统做法是每次都要去超市买新鲜食材,费时又麻烦。现在,你有一个智能冰箱,里面存着各种食材的虚拟模型,可以模拟出不同菜肴的味道和效果。你用这个模型试验不同的配料组合,快速得到结果,然后再用少量真实食材验证。这样一来,你就不用每次都去超市买新鲜食材,只需偶尔验证模型的准确性。这个过程就像用“虚拟厨房”替代真实厨房,大大提高了做菜的效率和创新速度。本文的WMRL也是如此,用“虚拟环境”模拟真实实验,减少昂贵的实际操作,快速训练出优秀的研究代理。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,每次试错都需要花费很多时间和精力。为了变得更厉害,你的朋友帮你设计了一个虚拟的游戏世界,可以模拟真实游戏的情况。你在这个虚拟世界里试验不同的策略,得到的结果可以告诉你在真实游戏中会发生什么。这样,你就不用每次都去真正的游戏场地练习,只用虚拟世界就能学到很多。这个虚拟世界就像是一个超级聪明的机器人助手,帮你节省时间,让你更快变强。论文里的方法也是一样,用虚拟的“世界模型”代替真实的环境,训练研究代理变得更快更省钱,同时还能保证效果。这就像用虚拟游戏帮你练习,最后再去真正的比赛,效果一样棒!

原文摘要

Automating empirical research is a long-standing direction of AI. Recent automatic research (AutoResearch) agents bring this goal within reach, as modern LLMs show the capability to independently implement solutions and learn from the execution outcomes. Behind these gains, post-training (especially RL) plays a central role. In this paper, we identify a fundamental tension when scaling RL for these agents: the two components of every AutoResearch trajectory (agent generation and environment execution) scale in very different manners, since all generation shares compute through batching, while each execution occupies its exclusive sandbox and real machine time. As a result, the environment execution dominates the training cost and becomes the bottleneck as trajectories grow. To resolve this tension, we propose World Model RL (WMRL), which replaces environment execution with a world model to remove this bottleneck. Additionally, the world model can be imperfect, as its rewards are corrupted by bias and noise. Therefore, we further equip WMRL with two mitigations, Online Debiasing and Inverse-Variance Denoising, which offset the bias and suppress the noise respectively. Theoretically, we prove that both mitigations of WMRL strictly improve the convergence guarantee. Empirically, WMRL accelerates training by 3-4x on various tasks at different agent scales, while exceeding the performance of standard RL baselines. Moreover, our post-trained 4B and 9B agents outperform much larger open-weight agents of 48B and 120B on held-out benchmarks. Beyond AutoResearch, WMRL also transfers to post-training embodied VLA policies, which demonstrates the generalizability of our method.

cs.LG