Graph-GRPO: Training Graph Flow Models with Reinforcement Learning

TL;DR

提出Graph-GRPO,结合分析转移概率与强化学习优化GFMs,50步达95%有效性。

cs.LG 🔴 高级 2026-03-11 40 次浏览
Baoheng Zhu Deyu Bo Delvin Ce Zhang Xiao Wang
图生成 强化学习 流模型 分子设计 深度学习

核心发现

方法论

本文提出基于分析表达式的GFMs转移概率,解决Monte Carlo采样非可微问题,结合GRPO实现端到端强化学习训练。引入局部扰动的细化策略,通过随机扰动节点和边,反复生成优化图,从而增强模型探索能力。利用合成与真实数据集验证,50步即可达到95%的有效性,显著优于传统方法。核心在于推导可微转移概率,结合策略梯度优化,提升生成质量与目标对齐。

关键结果

  • 在平面和树形数据集上,Graph-GRPO分别取得95.0%和97.5%的有效-唯一-新颖度(VUN)指标,远超基线模型。仅用50步,超越1,000步的扩散模型和遗传算法,展现高效性。
  • 在分子优化任务中,Graph-GRPO超越基于图和片段的RL方法,获得最优或次优的结合亲和性分数,显著提升采样效率和目标匹配度。

研究意义

该研究突破了GFMs在复杂目标优化中的瓶颈,通过分析转移概率实现可微训练,结合强化学习与局部细化策略,有效对齐人类偏好和任务目标。推动图生成在药物设计、蛋白对接等领域的应用,解决高维空间探索难题,为深度生成模型提供新思路。

技术贡献

核心贡献在于推导GFMs的解析转移概率,替代Monte Carlo采样,确保梯度流通,支持端到端强化学习。引入局部扰动细化机制,结合GRPO优化策略,有效提升生成质量。实现多任务、多场景下的高效优化,拓展了流模型在结构生成中的应用边界。

新颖性

首次在GFMs中引入解析转移概率,解决非可微问题,结合强化学习实现端到端训练。提出局部扰动细化策略,增强模型探索能力,显著优于传统采样和优化方法,开启图生成新范式。

局限性

  • 方法依赖于精确的转移概率推导,复杂图结构可能增加计算成本,且在极端高维空间中仍存在探索瓶颈。
  • 细化策略虽提升局部优化,但在全局多模态目标中可能陷入局部最优,需结合多样化探索机制。
  • 模型训练对硬件资源要求较高,实际应用中需优化算法效率和扩展性。

未来方向

未来将结合多尺度、多模态信息,提升模型对复杂目标的适应性。探索更高效的转移概率推导与采样策略,结合自监督和迁移学习,扩展到更大规模图结构,推动实际药物设计和材料优化应用。

AI 总览摘要

图生成作为深度学习中的核心任务,广泛应用于药物设计、蛋白对接等领域。然而,现有的离散流模型(如DeFoG)在目标优化和复杂偏好对齐方面仍面临挑战。传统方法多依赖Monte Carlo采样,导致梯度难以传递,限制了端到端强化学习的实现。本文提出Graph-GRPO,通过推导GFMs的解析转移概率,解决了非可微问题,实现了模型的全流程强化学习训练。

核心创新在于引入局部扰动的细化策略,利用随机扰动节点和边,反复优化生成图,从而增强模型探索能力。结合Group Relative Policy Optimization(GRPO)算法,本文实现了高效的目标对齐与优化。在多个合成和真实数据集上的实验显示,50步即可达到95%的有效性,远优于传统扩散模型和遗传算法。

在分子优化任务中,Graph-GRPO超越了现有的RL和片段基方法,获得更高的结合亲和性和多样性指标。这一研究不仅推动了图生成模型的理论发展,也为药物设计、蛋白质工程等实际应用提供了强有力的工具。未来,将结合多尺度信息和更高效的采样策略,拓展模型在大规模复杂图结构中的应用潜力,推动深度生成模型的产业化落地。

深度分析

研究背景

图生成技术经历了从自回归、一次性到流和扩散模型的演变,代表性工作包括GraphRNN、GraphGen、DeFoG等。早期模型在结构多样性和生成效率方面取得一定突破,但在目标优化、偏好对齐方面仍受限。近年来,强化学习结合生成模型成为热点,旨在引导模型生成符合特定目标的图结构,解决高维空间探索难题。尽管如此,现有流模型多依赖Monte Carlo采样,导致梯度难以传递,限制了端到端优化能力。本文在此背景下,提出基于解析转移概率的GFMs训练框架,结合强化学习,推动图生成技术向更高效、更智能方向发展。

核心问题

现有GFMs在复杂目标优化中表现有限,主要因采样过程非可微,难以结合策略梯度进行端到端训练。此外,生成过程缺乏有效的局部探索机制,导致难以在高潜力区域找到优质解。如何在保证生成多样性和结构合理性的同时,实现目标的高效对齐,成为亟待解决的问题。这不仅关系到药物设计的效率,也影响到大规模图结构的探索能力,制约了深度生成模型的实际应用。

核心创新

本研究的创新点包括:1)推导GFMs的解析转移概率,替代Monte Carlo采样,确保梯度连续性,实现端到端强化学习训练;2)引入局部扰动的细化策略,通过随机扰动节点和边,反复生成优化图,增强模型探索能力;3)结合GRPO算法,优化目标函数,提升目标对齐效率。这些创新突破了传统流模型在目标优化中的瓶颈,为图生成提供了新的理论基础和工程手段。

方法详解

  • �� 解析转移概率:推导GFMs的精确表达式,连接模型预测与状态转移,确保梯度可传递。• 端到端训练:利用策略梯度(如GRPO)优化模型参数,结合奖励函数实现目标导向的生成。• 局部细化:随机扰动节点和边,反复生成高质量图,增强模型探索能力。• 采样机制:采用可微的转移概率,支持多步反向传播,提升训练效率。• 结合奖励:设计多目标奖励(有效性、结构相似性、目标匹配),引导模型生成符合偏好的图结构。

实验设计

在合成的平面和树形数据集,以及真实的分子优化任务上,验证模型性能。采用指标包括有效-唯一-新颖度(VUN)、结合亲和性、结构相似性等。设置基线模型如GraphDiffusion、Genetic Algorithms,比较不同步数和细化策略的效果。通过消融实验分析RL训练、细化策略和预筛选的贡献。多次采样确保统计显著性,验证模型在高效性和目标对齐方面的优越性。

结果分析

Graph-GRPO在平面和树形数据集上,50步即可达95%和97.5%的VUN指标,显著优于1,000步的扩散模型和遗传算法。在分子优化中,超越现有RL和片段方法,获得更高的结合亲和性分数,采样效率提升3-5倍。 Ablation分析显示,解析转移概率和局部细化策略是性能提升的关键因素,验证了设计的有效性。整体结果表明,该方法在多任务、多场景下具有强大适应性和优越性。

应用场景

该技术可广泛应用于药物设计、蛋白质工程、材料科学等领域,特别适合需要目标导向、结构多样的图结构生成。通过结合奖励函数,模型可以优化特定性质,如结合亲和性、毒性、药效等。未来,结合大规模数据和多模态信息,有望实现更复杂的结构设计和优化,推动产业化应用。

局限与展望

当前方法在高维复杂图结构中计算成本较高,解析转移概率推导在极端场景下可能复杂化。细化策略虽增强探索,但易陷入局部最优,需结合多样化探索机制。模型对硬件资源要求较高,实际应用中需优化算法效率和扩展性。此外,目标函数设计依赖专家知识,未来需自动化和多目标平衡机制。

通俗解读 非专业人士也能看懂

想象你在做一个巧克力工厂,你需要设计出既好吃又漂亮的巧克力。传统方法就像用手工一块块拼装,效率低且不一定符合所有要求。现在,科学家们用一种叫做“流模型”的智能机器,能像流水线一样自动生成巧克力,但它们有个问题:不知道怎么调整才能让巧克力更符合口味。本文提出一种新方法,就像给机器装上了“智能指南针”,它可以根据目标不断调整,甚至在某个区域反复试验,找到最好的配方。通过这种方式,工厂能更快、更准地做出符合要求的巧克力,不仅节省时间,还能满足不同客户的需求。这就像让工厂变得更聪明、更灵活,能应对各种挑战,做出最棒的产品。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏,你要拼出一幅漂亮的画,但拼图很多,怎么拼都很难找到最好的组合。以前的方法就像随便试,每次都要重新开始,耗时又不一定成功。现在,科学家们发明了一种聪明的拼图助手,它能记住每次拼的样子,然后根据目标不断调整拼图,把碎片放到最合适的位置。这个助手还会在某些地方反复试验,确保拼出来的画既漂亮又符合要求。这样一来,你就能更快拼出心仪的画,而且还能不断改进。这个助手就像论文里的新算法,帮我们在复杂的图形世界里找到最好的设计方案,既聪明又高效。

原文摘要

Graph generation is a fundamental task with broad applications, such as drug discovery. Recently, discrete flow matching-based graph generation, \aka, graph flow model (GFM), has emerged due to its superior performance and flexible sampling. However, effectively aligning GFMs with complex human preferences or task-specific objectives remains a significant challenge. In this paper, we propose Graph-GRPO, an online reinforcement learning (RL) framework for training GFMs under verifiable rewards. Our method makes two key contributions: (1) We derive an analytical expression for the transition probability of GFMs, replacing the Monte Carlo sampling and enabling fully differentiable rollouts for RL training; (2) We propose a refinement strategy that randomly perturbs specific nodes and edges in a graph, and regenerates them, allowing for localized exploration and self-improvement of generation quality. Extensive experiments on both synthetic and real datasets demonstrate the effectiveness of Graph-GRPO. With only 50 denoising steps, our method achieves 95.0\% and 97.5\% Valid-Unique-Novelty scores on the planar and tree datasets, respectively. Moreover, Graph-GRPO achieves state-of-the-art performance on the molecular optimization tasks, outperforming graph-based and fragment-based RL methods as well as classic genetic algorithms.

cs.LG