Where to cut, how deep: BPE and Unigram-LM on chemistry SMILES

TL;DR

本研究比较化学SMILES的BPE与Unigram-LM分词器,在165-token基础上构建不同词表,发现二者构建的子词几乎不重叠,强调分词算法为模型设计的关键决策。

cs.CL 🔴 高级 2026-07-07 54 次浏览
Hunter Heidenreich
化学语言模型 子词编码 BPE Unigram-LM SMILES

核心发现

方法论

本文在固定的165字符基础上,系统比较了BPE与Unigram-LM两种子词编码算法在不同语料(多样、药物类、天然产物)及词表大小(256、512、1024)下的表现。通过控制预分词边界策略(跨括号与不跨括号)和语料类型,分析两算法在子词成员、粒度和频率分布上的差异。未进行下游模型训练,仅对分词器进行评估,确保差异源自算法本身。

关键结果

  • 两算法在所有22个匹配条件下,构建的子词几乎不重叠(Jaccard系数不超过0.161,频率加权后最大为0.05),显示其构建的词表结构差异显著。Unigram-LM在未见分子上分割出29-41%的额外子词,粒度更细,分词深度明显优于BPE。BPE的分词是Unigram-LM的粗粒化版本,覆盖率和成员差异在不同语料和词表规模中持续存在,且在扩大到8倍规模后仍未收敛。
  • 研究发现子词算法的选择是模型设计的关键决策,而非默认参数。两算法在子词成员、粒度和分布上的差异,影响后续模型的表示能力和泛化性能。

研究意义

该研究揭示了子词编码在化学SMILES中的结构性差异,挑战了自然语言中BPE作为默认的子词算法的普遍性。强调在化学领域,子词算法的选择直接影响模型的表达能力和泛化能力,为未来化学语言模型设计提供理论基础。此发现促使研究者重新审视子词编码的合理性,推动开发更适合化学语料的编码策略,有助于提升药物设计、化学反应预测等应用的性能。

技术贡献

本研究首次在固定化学字库基础上,系统比较了BPE与Unigram-LM在不同语料和词表规模下的表现,提出了子词成员、粒度和频率分布的差异指标。通过控制预分词边界策略,明确了子词算法在化学SMILES中的结构性差异,验证了子词算法非可互换的设计决策地位。未进行下游模型训练,确保分析纯粹反映算法本身,为子词编码的理论理解提供了新视角。

新颖性

本研究首次在化学SMILES的固定字库条件下,系统对比BPE与Unigram-LM的子词构建差异,强调子词算法在化学语料中的结构性差异,突破了以往仅在自然语言中的研究范畴。提出子词算法非默认选择,强调模型设计中的决策作用,为化学语言模型的优化提供新思路。

局限性

  • 未进行下游任务的模型训练,无法直接评估子词差异对模型性能的影响,未来需结合实际任务验证。
  • 只在固定字库条件下分析,未考虑字库扩展或动态调整的影响,未来应扩展到更大规模或动态子词学习场景。
  • 实验仅基于SMILES表示,未考虑其他化学表示法(如SELFIES),未来可拓展至多模态或多表示体系。

未来方向

未来将结合下游任务(如分子性质预测、反应模拟)验证子词差异对模型性能的影响,探索更适合化学语料的子词编码策略。同时,考虑动态子词学习和多模态信息融合,推动化学语言模型的实际应用和理论发展。

AI 总览摘要

化学SMILES作为化学信息表达的重要形式,子词编码策略直接影响模型的表达能力。传统上,领域内沿用自然语言中的字节对编码(BPE),但其在化学语料中的适用性尚未充分验证。本文系统比较了BPE与Unigram-LM两种子词算法,在固定165字符基础上,覆盖多样、药物和天然产物三类语料,词表规模从256到1024。研究发现,两算法在子词成员、粒度和频率分布上差异显著,构建的子词几乎不重叠,且在扩大到8倍规模后仍未收敛。这表明子词算法的选择是模型设计中的关键决策,而非默认参数。实验中未进行下游模型训练,确保分析纯粹反映算法特性,结果揭示了化学语料中子词结构的本质差异,为未来化学语言模型设计提供理论基础。该研究挑战了自然语言中BPE的普遍性,强调在化学应用中应慎重选择子词策略,以提升模型性能和泛化能力。未来,结合实际任务验证子词差异对模型性能的影响,将推动化学AI的发展,优化药物设计和反应预测等关键应用。

深度解读

原文摘要

Every chemical language model reading SMILES begins with a tokenizer, yet the field has inherited byte-pair encoding (BPE) from natural language with little scrutiny. In natural language, BPE's principal alternative, Unigram-LM, is known to build structurally different vocabularies. Whether that contrast survives in chemistry was open. We report a controlled comparison of BPE and Unigram-LM over a fixed 165-token chemistry base, at the small vocabulary sizes where token embeddings are learnable, across three corpus typologies (diverse, drug-like, natural-products) and both pre-tokenization boundary policies. The two do not converge. In all 22 matched conditions they build near-disjoint subword vocabularies: cross-algorithm Jaccard overlap on the learned pieces never exceeds 0.161, and at most 0.05 once weighted toward the high-frequency pieces a model updates most. Unigram-LM also segments held-out molecules into 29-41% more tokens; the arms largely agree on where to cut but not how deeply, so BPE's segmentation is a strict coarsening of Unigram-LM's on 80-99% of molecules. The separation holds across corpus, boundary, and vocabulary size, persisting even at eight times that scale. The subword algorithm is therefore a modeling decision, not a free default. The study trains no language models.

cs.CL cs.LG q-bio.BM