Molecular Déjà Vu: Digit-Level Retrieval of Published Values in Frontier Language Models

TL;DR

研究发现大型语言模型在分子回归基准中存在广泛的逐字检索现象,影响预测准确性。

cs.AI 🔴 高级 2026-09-05 91 次浏览
Matthias Busch Marius Tacke Sviatlana V. Lamaka Mikhail L. Zheludkevich Christian J. Cyron Roland C. Aydin Christian Feiler
大型语言模型 分子属性预测 基准污染 逐字检索 模型评估

核心发现

方法论

研究通过对22个前沿模型在12个回归基准上的逐字检索进行审计,采用两种推理水平进行实验,发现推理水平会影响检索结果。通过抑制检索,预测误差在相对意义上更接近。

关键结果

  • 在五个数据集上,超过50%的模型显示出逐字检索现象。
  • 在较高推理水平下,检索标记率比最低水平高出89%。
  • 抑制检索后,预测误差在不同模型间的相对距离缩小。

研究意义

研究揭示了大型语言模型在分子属性预测中的记忆化问题,挑战了模型评估的有效性。这对学术界和工业界在模型开发和评估中具有重要影响。

技术贡献

提供了一种新的方法来测量和抑制大型语言模型中的逐字检索现象,提出了在模型评估中考虑记忆化影响的必要性。

新颖性

首次系统性地揭示了大型语言模型在分子回归基准上的逐字检索现象,并提出了抑制检索的方法。

局限性

  • 模型在某些基准上的逐字检索现象未能完全消除。
  • 推理水平对检索的影响机制尚不明确。

未来方向

未来研究可以探索更有效的检索抑制方法,以及在其他领域的应用。

AI 总览摘要

大型语言模型(LLMs)在分子属性预测中表现出色,但其预测能力可能受到逐字检索现象的影响。研究对22个前沿模型在12个回归基准上进行了审计,发现逐字检索现象广泛存在,尤其是在FreeSolv和ESOL等数据集上。通过抑制检索,研究发现模型的预测误差在不同模型间的相对距离缩小,这表明模型的预测能力不仅仅取决于记忆化的数值。研究为模型评估提供了新的视角,强调了在模型开发中考虑记忆化影响的重要性。未来研究可以探索更有效的检索抑制方法,以及在其他领域的应用。

深度分析

研究背景

近年来,大型语言模型在自然语言处理和分子属性预测中取得了显著进展。然而,模型的预测能力可能受到训练数据记忆化的影响,这对模型评估提出了挑战。

核心问题

大型语言模型在分子属性预测中的逐字检索现象可能导致模型评估不准确,因为模型可能仅仅是检索而非预测。

核心创新

研究首次系统性地揭示了大型语言模型在分子回归基准上的逐字检索现象,并提出了抑制检索的方法。

方法详解

  • �� 审计22个前沿模型在12个回归基准上的逐字检索现象
  • �� 采用两种推理水平进行实验
  • �� 测试抑制检索的方法

实验设计

实验在22个模型和12个基准上进行,使用两种推理水平,测试逐字检索现象的广泛性和抑制检索的方法。

结果分析

研究发现,在五个数据集上,超过50%的模型显示出逐字检索现象。抑制检索后,预测误差在不同模型间的相对距离缩小。

应用场景

研究结果对模型评估和开发具有重要意义,特别是在分子属性预测和其他领域的应用中。

局限与展望

尽管研究揭示了逐字检索现象,但在某些基准上的现象未能完全消除,且推理水平对检索的影响机制尚不明确。

通俗解读 非专业人士也能看懂

想象一个工厂,工人们需要根据图纸制造产品。大型语言模型就像这些工人,但有时他们只是记住了图纸,而不是理解如何制造产品。研究发现,模型在分子属性预测中可能只是检索已知的数值,而非真正预测。通过调整工厂的工作流程,研究尝试减少这种记忆化现象,使工人们更加专注于理解和创新。

简单解释 像给14岁少年讲一样

嘿,小伙伴们!你知道吗?有些超级聪明的计算机模型就像你考试时的记忆高手,它们能记住很多答案!但有时候,它们只是记住了答案,而不是理解了问题。科学家们发现,这些模型在预测分子属性时,可能只是检索已知的数值,而不是做出真正的预测。为了让这些模型更聪明,科学家们正在研究如何让它们少记忆,多思考!

术语表

大型语言模型 (LLM)

一种能够处理和生成自然语言的大规模神经网络模型。

用于分子属性预测的模型。

逐字检索

模型直接检索已知数据而非进行预测的现象。

在分子回归基准中被发现。

推理水平

模型在生成答案时使用的逻辑和计算复杂度。

影响模型的逐字检索现象。

记忆化

模型在训练过程中记住了训练数据的现象。

对模型预测能力的评估提出挑战。

基准污染

由于训练数据的重叠导致模型评估不准确的现象。

在模型评估中需要考虑。

开放问题 这项研究留下的未解疑问

  • 1 如何有效抑制模型的逐字检索现象?
  • 2 推理水平对检索的影响机制是什么?

应用场景

近期应用

分子属性预测

提高模型的预测准确性,减少记忆化影响。

远期愿景

智能化模型评估

开发更智能的模型评估方法,确保模型的真正预测能力。

原文摘要

Large language models (LLMs) are increasingly evaluated on molecular property benchmarks, but accuracy cannot distinguish a model that predicts a property from one that retrieves a published number. We audit 22 frontier models on 12 regression benchmarks for verbatim retrieval and find that it is widespread but relatively benchmark-specific: on five datasets more than $50\%$ of the LLMs show verbatim retrieval, while on the remaining datasets it appears only in isolated cells. We run our experiments at two reasoning levels and find that reasoning changes retrieval. The same experiments, on the same molecules and with the same prompt, are flagged $89\%$ more often at the higher reasoning level than at the lowest one. Finally, we test a way to interrupt retrieval in our most contaminated cases, and find that the strongest models in some cases still recognise a combination of transformed SMILES strings and original labels. Furthermore, suppressing retrieval moves the prediction errors of the different models closer together in relative terms, while their differing use of verbatim retrieval spreads them apart. This indicates that the general predictive capability of an LLM is not determined solely by the amount of memorised values. This work provides an overview of the amount and depth of verbatim retrieval in molecular regression benchmarks using LLMs.

cs.AI