VGAS: Variance-Reduced Guidance and Adaptive Selection for Training-Free Reward Alignment in Discrete Diffusion

TL;DR

VGAS通过减少方差和自适应选择实现无训练奖励对齐,提升生物序列生成效果。

cs.LG 🔴 高级 2026-08-27 5 次浏览
Kwanyoung Kim
离散扩散 奖励对齐 无训练 生物序列 方差减少

核心发现

方法论

VGAS是一种在推理时减少指导估计方差并进行自适应选择的框架。它通过在干净标记的logits中应用奖励倾斜来保持预训练计划,并在每一步设置选择温度。

关键结果

  • 在DNA、蛋白质和小分子基准测试中,VGAS在无训练奖励对齐上表现最佳,并且匹配或超过了奖励微调生成器。
  • VGAS在DNA增强子设计中实现了99.1%的ATAC准确率,超过了DRAKES的92.4%。
  • 在蛋白质设计中,VGAS-GR和VGAS-RO分别在不同路径上超过了所有无训练基线。

研究意义

VGAS在不需要重新训练生成器的情况下,实现了高效的奖励对齐。这在需要频繁调整奖励目标的应用中具有重要意义,如生物序列设计。通过减少方差和自适应选择,VGAS提供了一种更具鲁棒性和灵活性的推理方法。

技术贡献

VGAS通过引入方差减少技术和自适应选择温度,解决了以往方法中固定选择温度和高方差指导估计的问题。它在推理过程中保持了预训练模型的完整性,同时实现了更高的奖励对齐效率。

新颖性

VGAS首次在离散扩散模型中结合方差减少和自适应选择,提供了一种无需重新训练生成器的奖励对齐方法。这一创新显著提高了推理效率和生成质量。

局限性

  • VGAS在高维数据集上的性能尚未充分验证,可能需要进一步优化。
  • 在某些非可微奖励场景中,方差减少效果有限。

未来方向

未来研究可以探索VGAS在其他领域的应用,如文本生成和代码生成。此外,进一步优化其在高维数据集上的性能也是一个重要方向。

AI 总览摘要

VGAS是一种针对离散扩散模型的无训练奖励对齐方法,旨在解决现有方法中高方差指导估计和固定选择温度的问题。通过在推理过程中减少方差和自适应调整选择温度,VGAS实现了更高效的奖励对齐。

在实验中,VGAS在DNA、蛋白质和小分子基准测试中表现出色,尤其是在DNA增强子设计中,其ATAC准确率达到99.1%,显著超过了现有的最佳方法DRAKES。通过在干净标记的logits中应用奖励倾斜,VGAS保持了预训练计划的完整性。

尽管VGAS在多个领域展示了其优越性,但在高维数据集上的性能仍需进一步验证。未来的研究可以探索其在其他生成任务中的应用,并优化其在复杂数据集上的表现。

深度分析

研究背景

离散扩散模型在文本、代码和生物序列生成中表现优异,但其训练目标仅奖励自然性。每次更改奖励目标都需要重新训练生成器,这既昂贵又不灵活。

核心问题

现有方法在推理时的指导估计方差高,选择温度固定,导致奖励对齐效率低。需要一种无需重新训练生成器的方法来实现高效的奖励对齐。

核心创新

VGAS通过减少指导估计的方差和自适应选择温度,解决了以往方法中的关键问题。它在推理过程中保持了预训练模型的完整性,并通过在干净标记的logits中应用奖励倾斜来提高生成质量。

方法详解

  • �� 使用Rao–Blackwell化技术减少可微奖励的方差
  • �� 使用留一法基线减少非可微奖励的方差
  • �� 在干净标记的logits中应用奖励倾斜
  • �� 自适应调整每一步的选择温度

实验设计

在DNA、蛋白质和小分子基准测试中进行实验。使用的基线包括DRAKES、DG、SMC等。主要评估指标为奖励对齐效率和生成质量。

结果分析

VGAS在所有基准测试中均表现优异,尤其是在DNA增强子设计中,其ATAC准确率达到99.1%。在蛋白质设计中,VGAS-GR和VGAS-RO分别在不同路径上超过了所有无训练基线。

应用场景

VGAS可应用于生物序列设计、文本生成和代码生成等领域,特别是在需要频繁调整奖励目标的场景中。

局限与展望

VGAS在高维数据集上的性能尚未充分验证,可能需要进一步优化。在某些非可微奖励场景中,方差减少效果有限。

通俗解读 非专业人士也能看懂

想象一个工厂,工人们在生产线上工作。每个工人都有自己的任务,但有时他们需要调整工作以提高产品质量。VGAS就像一个聪明的主管,他能实时调整工人的任务分配,以确保生产出更高质量的产品,而不需要停下生产线进行全面培训。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你需要在不改变角色技能的情况下,提高得分。VGAS就像一个超级外挂,它能在你玩游戏的过程中,实时调整策略,让你在不改变角色的情况下,获得更高的分数。是不是很酷?

术语表

离散扩散模型

一种生成模型,通过逐步揭示被掩盖的序列来生成数据。

用于文本、代码和生物序列生成。

奖励对齐

在生成过程中偏向于高奖励区域的方法。

VGAS通过奖励对齐提高生成质量。

方差减少

减少估计过程中的随机性,以提高结果稳定性。

VGAS通过方差减少提高指导估计的准确性。

自适应选择

根据当前状态动态调整选择参数的方法。

VGAS在推理过程中自适应调整选择温度。

干净标记的logits

未被掩盖的序列的概率分布。

VGAS在此应用奖励倾斜以保持预训练计划。

开放问题 这项研究留下的未解疑问

  • 1 VGAS在高维数据集上的性能尚未充分验证,可能需要进一步优化。
  • 2 在某些非可微奖励场景中,方差减少效果有限。

应用场景

近期应用

生物序列设计

VGAS可用于优化DNA和蛋白质序列的设计,提高生物实验的效率。

远期愿景

通用生成模型

VGAS的技术可扩展到其他生成任务,如文本和代码生成,具有广泛的应用潜力。

原文摘要

Masked discrete diffusion models perform strongly on text, code, and biological sequences, but their training objective rewards only naturalness, and retraining the generator for every new reward is expensive. Inference-time steering of a frozen model either guides the sampler by the reward gradient or searches over several trajectories, and recent samplers combine the two. Such combinations are assembled as pipelines that leave three choices at their defaults: a guidance estimate resting on one Gumbel draw per sample, a reward tilting placed without reference to the distribution the combination then targets, and a selection temperature held fixed although the spread of per-step rewards drifts. We identify that distribution and settle the three choices against it. We therefore propose Variance-reduced Guidance and Adaptive Selection (VGAS), a simple yet effective inference-time framework that reduces the variance of the guidance estimate for both reward types, applies the reward tilting in the clean-token logits, where the pretrained schedule is preserved, and sets the selection temperature per step. Across regulatory DNA, protein and small-molecule benchmarks, VGAS attains the best training-free reward and matches or surpasses a reward-fine-tuned generator.

cs.LG cs.CE q-bio.QM stat.ML