Structure-based drug design by denoising voxel grids

TL;DR

VoxBind利用3D体素去噪模型,基于蛋白结构生成高效多样的药物分子。

cs.LG 🔴 高级 2024-05-07 39 次浏览
Pedro O. Pinheiro Arian Jamasb Omar Mahmood Vishnu Sresht Saeed Saremi
药物设计 生成模型 3D体素 深度学习 结构生物学

核心发现

方法论

VoxBind采用基于分数的生成框架,将分子表示为三维原子密度体素网格,利用3D U-Net结构学习条件得分函数。模型通过扩展神经经验贝叶斯(NEB)方法,将条件概率分布转化为两个步骤:首先用未阻尼Langevin MCMC采样噪声分子,然后用单步去噪估计纯净分子。训练时,模型学习条件得分函数g(y|ξ),实现对蛋白口袋条件下的分子生成。采样过程中,结合Langevin动力学和贝叶斯估计,快速生成多样化、结合亲和力更高的候选分子。

关键结果

  • 在CrossDocked2020数据集上,VoxBind在VinaScore(-6.94)优于现有方法(如DecompDiff的-5.67),且生成分子更具多样性,结合亲和力提升71.3%。模型训练简单,采样速度快,平均每个分子生成时间显著低于Diffusion方法,且生成分子更少空间冲突。
  • 在多项指标(如QED、SA评分)上,VoxBind均优于对比模型,且抗 steric clashes能力增强,结合能更优,表现出优异的药效潜力。
  • 通过消融实验验证,模型的条件编码和去噪网络设计对性能影响显著,采用单一噪声水平简化训练流程,提升采样效率。

研究意义

该研究突破了传统基于点云的结构药物设计方法,提出利用体素表示结合分数模型实现高效、可扩展的条件分子生成。模型在药物研发中具有重要应用价值,能显著提升候选药物的多样性和结合亲和力,降低筛选成本,为精准药物设计提供新工具。其简洁高效的训练和采样流程,为工业界实现大规模药物生成提供可能,推动药物设计向深度学习驱动的智能化迈进。

技术贡献

本文创新性地将神经经验贝叶斯扩展到条件生成任务,提出基于3D体素的score-based模型,利用卷积神经网络(U-Net)学习条件得分函数。模型避免空间原子移动带来的冲突问题,简化训练流程,显著提升采样速度。与点云Diffusion模型相比,模型在表达能力和效率上具有优势,结合Langevin动力学实现高质量分子生成,具有理论保证和工程可行性。

新颖性

首次将score-based生成模型应用于基于体素的结构药物设计,突破了点云和SE(3)-等变模型的限制,提出单一噪声水平的去噪架构,结合贝叶斯估计实现高效采样。模型在药物设计中的应用展现出比传统方法更高的多样性和结合亲和力,具有明显创新点。

局限性

  • 模型依赖于高质量的体素化输入,可能在复杂蛋白结构或稀疏区域表现不足,且对不同蛋白类型的泛化能力仍需验证。
  • 采样过程中对蛋白口袋的精确定位和体素参数敏感,可能影响生成分子的质量和多样性。
  • 目前主要在虚拟筛选指标上验证,实际药效和毒性等生物学性能仍需后续实验验证。

未来方向

未来将结合多尺度建模和蛋白-配体相互作用的动力学信息,提升生成分子的生物活性预测能力。同时,探索多模态输入(如电子密度图、药理信息)以增强模型泛化能力,推动模型向临床药物候选的转化。还计划优化算法以支持更大尺度的分子生成,满足工业级药物设计需求。

AI 总览摘要

药物设计一直面临着高维空间探索的挑战,传统的虚拟筛选方法效率有限,难以充分挖掘化学空间的潜力。近年来,深度生成模型为药物研发带来了新希望,但多依赖点云或复杂的对称性保持机制,限制了其应用效率。

本文提出VoxBind,一种基于3D体素的分数模型,结合神经经验贝叶斯(NEB)框架,专为蛋白-配体结构条件下的药物分子生成设计。模型利用卷积神经网络(U-Net)学习条件得分函数,通过两步采样策略:先用未阻尼Langevin动力学在平滑分布中采样噪声分子,再用贝叶斯估计还原纯净分子。该方法简洁高效,训练只需单一噪声水平,采样速度远超传统扩散模型。

在CrossDocked2020数据集上,VoxBind在结合亲和力指标VinaScore达到-6.94,优于现有点云Diffusion模型,生成的分子多样性更高,空间冲突更少,结合能更优。多项虚拟筛选指标显示其在药物候选筛选中表现优异,具有潜在的工业应用价值。模型的创新点在于将score-based生成思想引入体素表示,突破了点云模型的表达局限,简化了训练流程,显著提升了效率和效果。

未来,结合多尺度建模和生物信息,将进一步提升模型的药效预测能力,推动其在药物研发中的实际应用。尽管如此,模型仍需验证在复杂蛋白环境和临床前试验中的表现,未来工作将聚焦于多模态融合和大规模生成能力的提升,为精准药物设计提供强大工具。

深度分析

研究背景

药物设计的核心目标是找到高效结合特定靶点的分子。传统方法如虚拟筛选依赖于结构匹配和评分函数,效率有限且难以探索庞大的化学空间。近年来,深度学习引入生成模型(如变分自编码器、扩散模型)极大改善了候选分子的多样性和质量,但多基于点云或复杂的对称性机制,计算成本高,泛化能力有限。体素表示作为一种空间离散化手段,能更直观捕捉分子和蛋白结构的表面和形状特征,结合score-based模型,有望实现更高效的结构条件生成。

核心问题

现有的结构药物设计模型在生成多样性、结合亲和力和避免空间冲突方面仍存在瓶颈。点云模型虽具表达能力,但计算复杂且难以保证空间一致性。基于体素的表示虽然直观,但缺乏高效的条件生成框架,限制了其应用潜力。如何在保证表达能力的同时,提升生成速度、多样性和结合效率,成为亟待解决的问题。

核心创新

本研究提出VoxBind,结合score-based生成思想和体素表示,创新点包括:

1)将神经经验贝叶斯扩展到条件生成任务,利用条件得分函数实现高效采样;

2)采用单一噪声水平的去噪网络,简化训练流程;

3)结合Langevin动力学和贝叶斯估计,实现快速多样化生成;

4)利用3D卷积和U-Net结构,有效捕捉空间特征,避免空间冲突。此方法突破了点云Diffusion模型的限制,兼具表达能力和效率,适应药物设计的实际需求。

方法详解

  • �� 将蛋白口袋和配体离散化为体素网格,分别用不同通道表示原子类型。
  • �� 构建条件得分函数g(y|ξ),通过训练去噪网络学习,输入为加噪声的配体和蛋白口袋。
  • �� 训练过程中,将配体加入高斯噪声,最小化去噪网络输出与真实配体的均方误差。
  • �� 采样时,利用未阻尼Langevin动力学在平滑分布中进行随机游走,逐步生成噪声配体。
  • �� 在预设步数后,用贝叶斯估计还原纯净分子,结合得分函数引导采样。
  • �� 最后通过峰值检测恢复原子坐标,实现从体素到原子级别的转换。

实验设计

采用CrossDocked2020数据集,进行蛋白-配体条件生成任务。模型输入为64×64×64的体素网格,训练时加入随机旋转和平移增强。指标包括VinaScore、结合能、药物相似性QED、药效评分SA,以及分子多样性和空间冲突。与Diffusion模型和变分自编码器等对比,验证模型在结合亲和力、生成速度和多样性方面的优越性。多次消融实验确认条件编码和单一噪声水平的有效性。

结果分析

在CrossDocked2020上,VoxBind的VinaScore达到-6.94,优于DecompDiff的-5.67,生成分子多样性提升,结合能更低。模型在药物相似性和药效指标上表现优异,且采样速度比点云Diffusion模型快数倍。消融实验显示,条件编码和贝叶斯估计对性能提升至关重要。模型还减少了空间冲突和分子应变能,显示出良好的药物候选潜力。

应用场景

该模型可用于药物筛选、候选分子设计和虚拟筛查,特别适合高通量筛选和个性化药物开发。只需蛋白结构信息,即可快速生成多样化候选分子,降低研发成本。未来结合药理学和毒理学信息,有望实现精准药物设计,推动个性化医疗。

局限与展望

模型依赖于高质量的体素化输入,复杂蛋白环境下表现尚待验证。生成的分子在实际药效和毒性方面还需生物实验验证。此外,模型对蛋白口袋的定位敏感,可能在稀疏或模糊结构中效果有限。未来需结合多尺度信息和生物学特征,提升实际应用能力。

通俗解读 非专业人士也能看懂

想象你在一个工厂里,工厂的任务是制造各种不同的玩具。工厂里有一台特别的机器,能根据你提供的样品和指示,快速制造出符合要求的玩具。这个机器就像VoxBind,它用一种叫“体素”的积木块,把玩具的每一部分都分成很多小块,然后学习如何用这些积木组成漂亮的玩具。

当你告诉机器你想要的玩具的样子(比如颜色、形状、大小),它会先用“噪声”把样品变得模糊,然后逐步还原出原本的样子。这个过程就像你在拼拼图,先把模糊的碎片拼成完整的玩具,再用经验告诉你,哪个拼图块应该放在哪里。这样,工厂可以很快制造出很多不同的玩具,而且每个都符合你的要求。

这个方法比以前用复杂的机械手臂慢多了,现在用这种“学习还原”的方式,不仅快,还能制造出更多样的玩具,甚至还能找到一些你没想到的好玩具。未来,这个机器还能帮科学家设计出新药,就像工厂帮你设计新玩具一样,变得更聪明、更快、更有趣。

简单解释 像给14岁少年讲一样

想象你在学校的科学实验室里,老师给你一堆不同的积木,任务是用这些积木拼出各种漂亮的模型。可是,这些积木被弄得很模糊,你看不清楚它们的样子。你需要用一种特别的方法,把模糊的积木还原成清晰的样子,然后拼出你想要的模型。

这个方法就像VoxBind,它用一种叫“去噪”的技术,先把模糊的模型变得更模糊,然后再逐步还原出原本清晰的样子。它学习了怎么把模糊的模型变成清晰的模型,就像你学会了怎么把模糊的照片变清楚一样。最后,它用这个技巧,快速生成很多不同的模型,每个都符合你给的条件,比如形状、大小和颜色。

这就像你用拼图游戏一样,先用模糊的碎片拼出大致的轮廓,然后慢慢还原细节,最后得到一个漂亮的模型。这个方法比以前的拼图方式快多了,还能拼出很多新奇的模型。未来,这个技术还能帮科学家设计新药,就像帮你设计新玩具一样,让药物变得更快、更好、更有趣!

术语表

Score-based generative model (得分模型)

一种通过学习数据的梯度信息(得分函数)来生成新样本的方法,利用反向扩散过程逐步还原目标分布。

本文利用score-based模型在3D体素空间中生成药物分子。

Neural Empirical Bayes (神经经验贝叶斯)

一种结合神经网络和贝叶斯推断的框架,用于条件概率分布的学习和采样,简化复杂模型的训练。

文章将NEB扩展到条件生成任务,提升效率。

Langevin MCMC (朗之万马尔科夫链蒙特卡洛)

一种利用梯度信息进行随机采样的算法,能在高维空间中高效逼近目标分布。

用于在平滑分布中采样噪声分子。

U-Net (U型网络)

一种编码-解码结构的卷积神经网络,擅长图像去噪和分割任务,能捕获多尺度信息。

用作条件得分函数的学习网络。

体素 (Voxel)

三维空间中的体积像素,用于离散化空间中的连续结构,便于深度学习处理。

将分子和蛋白质结构表示为3D体素网格。

开放问题 这项研究留下的未解疑问

  • 1 模型在极端复杂蛋白环境下的泛化能力尚未验证,特别是在稀疏或模糊结构中表现不足。未来需结合多尺度和多模态信息,提升实际药效预测和临床转化能力。

应用场景

近期应用

药物候选筛选

利用VoxBind快速生成多样化候选分子,辅助虚拟筛查,降低研发成本,提升药物发现效率。

个性化药物设计

根据患者特定蛋白结构,定制高亲和力分子,推动精准医疗。

远期愿景

自动化药物开发平台

结合多模态信息和生物实验数据,实现全流程自动化药物设计,从结构到药效预测一站式解决方案。

原文摘要

We present VoxBind, a new score-based generative model for 3D molecules conditioned on protein structures. Our approach represents molecules as 3D atomic density grids and leverages a 3D voxel-denoising network for learning and generation. We extend the neural empirical Bayes formalism (Saremi & Hyvarinen, 2019) to the conditional setting and generate structure-conditioned molecules with a two-step procedure: (i) sample noisy molecules from the Gaussian-smoothed conditional distribution with underdamped Langevin MCMC using the learned score function and (ii) estimate clean molecules from the noisy samples with single-step denoising. Compared to the current state of the art, our model is simpler to train, significantly faster to sample from, and achieves better results on extensive in silico benchmarks -- the generated molecules are more diverse, exhibit fewer steric clashes, and bind with higher affinity to protein pockets. The code is available at https://github.com/genentech/voxbind/.

cs.LG q-bio.BM