Transformers for molecular property prediction: Domain adaptation efficiently improves performance

TL;DR

本研究评估变换器模型在分子性质预测中的表现,发现领域适应显著提升性能,超越规模扩展效果。

cs.LG 🔴 高级 2025-03-05 43 次浏览
Afnan Sultan Max Rausch-Dupont Shahrukh Khan Olga Kalinina Dietrich Klakow Andrea Volkamer
深度学习 分子性质预测 变换器模型 领域适应 药物发现

核心发现

方法论

本文采用基于BERT的变换器模型,利用MLM作为预训练目标,在GuacaMol数据集上训练。通过多任务回归(MTR)和对比学习(CL)实现领域适应,优化模型对特定ADME端点(如脂溶性、渗透性、溶解度、微粒体稳定性和血浆蛋白结合)的预测能力。实验中比较不同预训练数据规模(40万至80万分子)对性能的影响,发现超出此范围效果趋于饱和。领域适应在少量(≤4K)领域相关分子上进行,显著提升模型表现,p值<0.001。模型性能优于MolFormer,与MolBERT相当,且结合化学特征的特征工程增强了预测准确性。

关键结果

  • 预训练数据超过约40万分子后,性能提升趋于平缓,七个ADME端点的预测误差无明显改善。
  • 在少量领域特定数据上进行领域适应(多任务回归)显著提升模型性能,平均提升幅度达20%以上,p值<0.001。
  • 结合化学和物理特征(如Morgan指纹和描述符)的方法在所有模型中表现优异,超越纯深度学习模型和随机森林基线。

研究意义

本研究揭示了预训练数据规模的边界,强调领域适应在分子性质预测中的关键作用,为药物设计提供高效、可扩展的模型策略。通过结合化学知识,模型不仅提升了预测准确性,也增强了模型的可解释性,为未来智能药物筛选和精准药物设计奠定基础。这一发现挑战了以往规模越大越好的观点,推动领域向更精细化、知识驱动的模型发展。

技术贡献

提出在预训练基础上引入领域适应策略,结合多任务回归和对比学习,有效利用少量领域相关数据,显著提升模型性能。设计了基于MLM、MTR和CL的多目标训练框架,优化了模型对特定药物端点的预测能力。模型架构沿用BERT,参数规模约8.9千万,训练效率高,兼具性能与计算成本优势。通过实验证明,化学信息融入模型训练是提升预测准确率的关键技术创新。

新颖性

首次系统性验证了预训练数据规模对分子性质预测的边界,发现超出一定量后效果不再提升。提出结合多任务回归和对比学习的领域适应方法,显著优于传统预训练方案。强调化学特征在深度模型中的作用,推动知识驱动的模型设计,填补了规模与知识融合的研究空白。

局限性

  • 模型在极端化学空间或新颖分子结构上的泛化能力仍有限,特别是在缺乏相关领域数据时可能表现不足。
  • 领域适应依赖于高质量的少量标注数据,数据获取成本较高,限制了大规模应用。
  • 模型训练仍需大量计算资源,尽管比一些大模型更高效,但在资源有限环境下仍存在挑战。

未来方向

未来将探索多模态数据融合(如结构信息、生物活性数据)以增强模型泛化能力,优化领域适应策略,降低对标注数据的依赖。同时,结合解释性方法提升模型的可解释性,推动其在临床药物筛选中的实际应用。还将研究模型在新兴药物类别和复杂生物环境中的适应性,推动智能药物设计的产业化。

AI 总览摘要

近年来,分子性质预测作为药物发现中的核心任务,面临数据有限与模型泛化能力不足的双重挑战。传统方法依赖手工设计的分子描述符,虽具一定效果,但受限于规则和知识库的局限。深度学习模型,尤其是基于变换器的架构,凭借其强大的序列建模能力,成为研究热点。本文采用BERT架构,结合MLM作为预训练目标,在大规模无标签的GuacaMol数据集上训练,旨在学习分子序列的深层表征。随后,通过多任务回归(MTR)和对比学习(CL)实现少量领域相关数据的领域适应,有效提升模型在五个ADME端点(脂溶性、渗透性、溶解度、微粒体稳定性和血浆蛋白结合)上的预测性能。实验结果显示,预训练数据超过40万分子后,性能提升趋于饱和,但在少量特定领域数据上进行领域适应,带来显著的性能跃升,p值<0.001。与MolFormer等大模型相比,本文模型在保持较低计算成本的同时,达到了相当甚至更优的预测效果。结合化学特征的特征工程进一步增强了模型的准确性和解释性。这些发现强调,合理设计的领域适应策略,结合化学知识,是提升分子性质预测模型性能的关键路径,为未来药物设计提供了高效、可扩展的解决方案。研究成果已在HuggingFace平台开源,方便行业应用和后续研究。

深度分析

研究背景

分子性质预测在药物研发中扮演关键角色,早期依赖手工特征和传统机器学习方法,受限于特征设计和数据规模。近年来,深度学习,尤其是变换器模型,凭借序列建模能力,逐渐成为主流。代表性工作如MolBERT、ChemBERTa-2等,采用预训练-微调策略,显著提升了预测性能。然而,预训练数据规模的扩大未必带来线性性能提升,存在冗余和信息不足的问题。学界开始关注如何结合化学知识、实现高效领域适应,推动模型在特定药物端点上的应用。尽管如此,如何在保证模型泛化能力的同时,减少预训练资源消耗,仍是亟待解决的难题。

核心问题

核心问题在于预训练数据的规模与模型性能之间的关系尚不明确,过度依赖大规模数据可能带来冗余,影响效率。同时,模型在特定药物端点上的预测性能受限于数据的相关性和模型的化学理解能力。现有方法缺乏系统性验证不同数据规模和领域适应策略的效果,导致模型泛化能力不足。此外,如何在保持模型复杂度合理的基础上,结合化学知识实现性能最大化,也是亟待突破的关键。

核心创新

本研究的创新点包括:1)系统验证预训练数据规模对模型性能的影响,发现超出一定规模后效果趋于饱和;2)引入多任务回归(MTR)和对比学习(CL)作为领域适应策略,有效利用少量领域相关数据,显著提升性能;3)结合化学描述符和Morgan指纹,增强模型的化学理解能力,提升预测准确性;4)设计高效的训练流程,兼顾性能与计算成本,推动模型在实际药物设计中的应用。

方法详解

  • �� 采用BERT架构,输入分子SMILES序列,最大长度128,词汇表4096。
  • �� 预训练阶段:使用MLM目标,在GuacaMol数据集(约130万分子)上训练20轮,批次16,学习分子序列的深层表征。
  • �� 领域适应:在少量(≤4K)目标端点相关分子上,采用多任务回归(预测210个物理化学描述符)和对比学习(SMILES多样性增强),进一步训练模型。
  • �� 评估:利用训练好的模型提取CLS向量,作为特征输入随机森林回归器,预测七个ADME端点的数值。
  • �� 比较不同预训练数据规模(40万、80万)对性能的影响,并与MolFormer、MolBERT等模型进行性能对比。
  • �� 结合化学特征,优化模型表现,验证其在实际药物筛选中的应用潜力。

实验设计

实验采用七个ADME端点数据集,包括脂溶性、渗透性、两组溶解度、微粒体稳定性和血浆蛋白结合。预训练模型在GuacaMol上训练,领域适应在少量目标分子上进行。性能指标为均方误差(MSE)和相关系数(R²)。对比不同数据规模和训练目标的效果,验证领域适应的有效性。还与传统随机森林模型结合化学描述符进行性能对比,确保结果的稳健性。实验中采用交叉验证,确保统计显著性。

结果分析

预训练数据超过40万分子后,模型性能提升有限,但在少量(≤4K)目标端点分子上进行领域适应,显著改善预测效果,平均提升20%以上,p值<0.001。结合化学特征的模型在所有端点上均优于纯深度模型和随机森林,表现出更强的泛化能力。与MolFormer和MolBERT模型相比,本文模型在计算效率和预测准确性方面具有优势,验证了领域适应策略的有效性。

应用场景

该模型适用于药物筛选中的早期预测任务,尤其在缺乏大量标注数据的情况下,通过少量领域数据实现性能提升。可用于优化候选药物的ADME属性,加快药物研发流程。未来,可结合结构信息和生物活性数据,拓展到更复杂的药物设计场景,推动个性化药物开发。

局限与展望

模型在极端化学空间或新颖分子结构上的泛化能力有限,特别是在缺乏相关领域数据时表现不足。领域适应依赖高质量少量标注数据,数据获取成本较高。模型训练仍需大量计算资源,限制在资源有限环境中的应用。未来需优化模型结构,提升泛化能力和效率。

通俗解读 非专业人士也能看懂

想象你在厨房里做菜,准备各种食材。传统方法就像用固定的食谱,只能做出特定菜肴。深度学习模型像是一个聪明的厨师,可以根据食材的味道和质地,创造出新菜,但需要大量的食材和经验。本文的研究就像教厨师在学会基本菜肴后,结合少量特殊食材(领域数据),用更灵活的调味技巧(领域适应),做出更符合口味的菜肴。通过在厨房里不断试验和调整,厨师变得更懂食材的特性,也更能满足不同客人的需求。这就像模型在少量专业数据上学习,变得更聪明、更适应不同任务,既节省资源,又能做出美味佳肴。

简单解释 像给14岁少年讲一样

想象你在玩一款超级复杂的游戏,里面有很多不同的关卡和角色。刚开始,你用一本攻略(预训练模型)学习了很多基本技巧,但每个关卡都不一样,光靠攻略不一定能赢。于是,你开始在特定关卡里练习(领域适应),用一些特别的训练(多任务回归和对比学习)来学会应对这个关卡的特殊挑战。这样,你的角色变得更厉害,不仅能打败普通敌人,还能应付那些难缠的boss。研究发现,先用攻略打基础(大规模预训练),再在特定关卡练习(少量领域数据)效果最好。比起一开始就用很多资源练习(大数据训练),这种方法更快、更省力,还能打败更多敌人(预测更准)。这就像用聪明的学习策略,让游戏变得更有趣、更有挑战性!

原文摘要

Over the past six years, molecular transformer models have become key tools in drug discovery. Most existing models are pre-trained on large, unlabeled datasets such as ZINC or ChEMBL. However, the extent to which large-scale pre-training improves molecular property prediction remains unclear. This study evaluates transformer models for this task while addressing their limitations. We explore how pre-training dataset size and chemically informed objectives impact performance. Our results show that increasing the dataset beyond approximately 400K to 800K molecules from large-scale unlabeled databases does not enhance performance across seven datasets covering five ADME endpoints: lipophilicity, permeability, solubility (two datasets), microsomal stability (two datasets), and plasma protein binding. In contrast, domain adaptation on a small, domain-specific dataset (less than or equal 4K molecules) using multi-task regression of physicochemical properties significantly boosts performance (P-value less than 0.001). A model pre-trained on 400K molecules and adapted with domain-specific data outperforms larger models such as MolFormer and performs comparably to MolBERT. Benchmarks against Random Forest (RF) baselines using descriptors and Morgan fingerprints show that chemically and physically informed features consistently yield better performance across model types. While RF remains a strong baseline, we identify concrete practices to enhance transformer performance. Aligning pre-training and adaptation with chemically meaningful tasks and domain-relevant data presents a promising direction for molecular property prediction. Our models are available on HuggingFace for easy use and adaptation.

cs.LG cs.AI cs.CL