Detecting Pretraining Data from Large Language Models

TL;DR

提出MIN-K% PROB,无需训练即可检测大模型预训练数据,提升7.4%。

cs.CL 🔴 高级 2023-10-26 37 次浏览
Weijia Shi Anirudh Ajith Mengzhou Xia Yangsibo Huang Daogao Liu Terra Blevins Danqi Chen Luke Zettlemoyer
大模型 数据检测 预训练数据 Membership Inference Attack 无监督方法

核心发现

方法论

该方法基于假设:未见样本中存在低概率异常词,而已见样本中较少此类词。通过计算文本中最低K%的词的平均对数似然,判断文本是否为预训练数据。无需训练参考模型,直接利用黑盒模型输出,简洁高效。核心算法MIN-K% PROB,结合Wikipedia时间戳数据,建立动态基准,支持多模型、多场景检测。

关键结果

  • 在WIKIMIA基准上,MIN-K% PROB比前沿方法提升7.4%的AUC,达0.72,表现优异。对LLaMA、GPT-Neo、Pythia等模型均有效,模型越大检测越准。文本长度越长,检测效果越好。应用于版权书籍识别、数据污染检测和隐私审计,均表现出稳定优势。
  • 在版权书籍检测中,AUC达0.88,识别出90%以上的高污染率书籍。在数据污染场景中,检测准确率显著优于传统方法,提升12.2%的TPR@5%FPR。
  • 通过不同模型规模和文本长度的实验证明,该方法具有良好的泛化能力和鲁棒性,适应多场景多模型检测需求。

研究意义

该研究突破了预训练数据检测的技术瓶颈,为模型透明性和数据隐私提供新工具。无需访问预训练语料或训练参考模型,极大降低检测成本,推动模型伦理和合规发展。对版权保护、数据污染识别及模型安全审计具有重要实际意义,有助于行业规范和学术研究的深入推进。

技术贡献

提出无监督、参考模型无依赖的MIN-K% PROB算法,基于低概率异常词检测,结合时间戳数据构建动态基准。创新在于无需训练参考模型,直接利用模型输出进行检测,提供理论保证和实证验证。算法简单高效,适应大规模模型,拓展了Membership Inference Attack的应用边界。

新颖性

首次提出无需参考模型的预训练数据检测方法,利用文本中低概率词的统计特性实现高效检测。区别于传统基于shadow模型的检测策略,极大简化了检测流程,增强了实用性。结合时间戳数据,建立动态基准,适应不断变化的预训练数据环境。

局限性

  • 在极短文本或高度 paraphrased 样本中检测效果可能下降,因低概率词特征不明显。
  • 对超大模型检测时,计算成本仍较高,尤其在多场景、多模型环境下。
  • 方法依赖时间戳信息,若数据来源不明确或时间不准确,效果受影响。

未来方向

未来将结合语义理解和上下文建模,提升对 paraphrased 样本的检测能力。探索多模态、多任务场景中的预训练数据识别,增强算法鲁棒性。还计划引入自适应阈值机制,提升不同场景下的检测精度与效率。

AI 总览摘要

随着大规模预训练语言模型(LLMs)的广泛应用,模型训练数据的透明度成为行业与学术界关注的焦点。当前,模型开发者多不披露训练数据的具体组成,导致版权、隐私和数据污染等问题难以追踪。传统检测方法依赖训练参考模型,成本高且不适用大模型的黑盒环境。本文提出MIN-K% PROB,一种无需训练参考模型、基于低概率异常词统计的预训练数据检测算法。该方法假设未见样本中存在少量低概率词,而已见样本中较少此类词,通过计算文本中最低K%的词的平均对数似然值,实现高效识别。结合Wikipedia时间戳数据,构建动态基准,支持多模型、多场景检测。实验证明,该方法在WIKIMIA基准上比现有最优方法提升7.4%的AUC,表现优异。其应用范围涵盖版权书籍识别、数据污染检测和隐私审计,均取得显著效果。该研究不仅提供了一个实用的检测工具,也推动了模型透明性和数据合规性的发展,为未来大模型的安全与伦理提供了技术支撑。未来工作将结合语义理解,提升对 paraphrased 样本的检测能力,并扩展到多模态、多任务环境中,进一步增强算法的鲁棒性和适应性。

深度分析

研究背景

近年来,随着GPT-4、LLaMA等大模型的崛起,训练数据的隐私、安全和版权问题日益突出。此前研究多集中在模型微调数据的检测(如Shokri等的Membership Inference Attack),但预训练数据的检测因数据规模巨大、不可访问而变得复杂。现有方法依赖训练参考模型,成本高昂且不适用黑盒环境。Wikipedia等公开数据成为主流预训练源,但其具体内容未公开,导致数据追踪困难。如何在不依赖训练数据和参考模型的情况下,准确识别模型的预训练数据,成为亟待解决的关键问题。

核心问题

核心问题是:在不了解预训练语料的前提下,如何判断一段文本是否为模型训练数据的一部分。挑战包括:缺乏预训练数据的分布信息,难以训练对比模型;预训练与微调不同,模型只见过每个样本一次,增加检测难度;此外,模型越大,记忆能力越强,检测越困难。解决此问题对于模型透明性、版权保护和隐私安全具有重要意义。

核心创新

本研究提出无参考模型的预训练数据检测算法MIN-K% PROB,基于低概率词的统计特性。创新点包括:1)无需训练shadow模型,直接利用模型输出的token概率进行检测;2)结合Wikipedia时间戳数据,建立动态检测基准;3)假设未见样本中存在少量低概率词,已见样本中较少此类词,从而实现高效区分。此方法简洁高效,适应大规模模型和多场景应用。

方法详解

  • �� 采集Wikipedia事件数据,划分为成员(2017年前)和非成员(2023年后)数据。• 利用模型输出的token概率,计算每个文本中最低K%的词的平均对数似然值。• 设定阈值,判断文本是否为预训练数据。• 结合时间戳信息,动态更新检测基准。• 通过在不同模型(LLaMA、GPT-Neo、Pythia)和不同文本长度(32-256)上验证效果。• 实现自动化数据采集和检测流程,保证持续更新和适应性。

实验设计

在WIKIMIA基准上,评估MIN-K% PROB与多种基线(如PPL、Neighbor、Zlib)在不同模型和文本长度下的性能。采用AUC、TPR@5%FPR指标,进行多场景测试,包括原始和paraphrased样本。还在版权书籍、数据污染和隐私审计中进行实证验证,确保算法的实用性和鲁棒性。超大模型检测时,计算成本虽高,但效果明显优于传统方法。

结果分析

MIN-K% PROB在WIKIMIA上平均AUC达0.72,比最优基线提升7.4%。模型越大、文本越长,检测效果越好。在版权检测中,AUC达0.88,识别出90%以上的版权书籍。数据污染检测中,TPR@5%FPR提升12.2%。实验证明,该方法在多模型、多场景中均表现优异,具有良好的推广潜力。

应用场景

可用于版权保护、数据污染识别、隐私审计等场景。无需访问预训练语料,操作简便,适合行业应用。未来还可结合语义理解,提升对 paraphrased 样本的检测能力,推动模型安全与合规发展。

局限与展望

在极短或高度 paraphrased 样本中,检测效果可能下降。对超大模型检测成本较高,且依赖时间戳信息。未来需优化算法鲁棒性,降低计算成本,扩展多模态应用。

通俗解读 非专业人士也能看懂

想象你在一家工厂里,工厂每天生产各种商品。工厂的员工知道哪些原料和工艺会用到,但外人不知道具体细节。有时候,工厂会用一些特殊的原料,这些原料在平时很少用到,但偶尔会出现。我们想知道,是否可以通过观察工厂的成品,判断它们是否用过那些特殊原料。这个方法就像用低概率出现的原料来检测工厂是否用过一样。我们不用知道工厂的全部秘密,只通过观察成品的某些特征,就能判断它们是否来自这个工厂。这样的方法简单高效,能帮助我们保护版权、检测数据污染,也能确保模型的安全和隐私。

简单解释 像给14岁少年讲一样

假设你在学校的厨房里,老师每天做很多不同的菜。有些菜是常做的,有些菜是偶尔才做。你想知道,某个菜是不是老师经常做的,还是偶尔做的。你可以观察菜里面的调料,发现偶尔用到一些特别的调料,而常做的菜里面很少出现这些特殊调料。用这个办法,你可以猜出这个菜是不是老师经常做的。我们用类似的方法,看看一段文字里面有没有一些很少出现的词,这样就能知道它是不是模型“学过”的内容。这种方法简单又快,不需要知道模型的秘密,就能帮我们找到那些可能被用过的内容。

术语表

Membership Inference Attack (成员推断攻击)

一种通过模型输出判断某数据是否在训练集中的技术,分为白盒和黑盒两类。

本文将其应用于检测预训练数据。

Negative Log-Likelihood (负对数似然)

衡量模型对某词预测的置信度,值越低代表越可能出现。

用于计算文本中低概率词。

Wikipedia时间戳 (Wikipedia timestamp)

标记Wikipedia页面创建或更新的时间,用于区分新旧数据。

构建动态检测基准。

AUC (曲线下面积)

衡量二分类模型性能的指标,值越接近1越好。

用于评估检测方法效果。

Paraphrase (释义重述)

用不同的表达方式传达相同意思的句子或段落。

检测方法在变换表达后仍有效。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升对高度 paraphrased 样本的检测准确性,尤其在极端重述或语义变化情况下。
  • 2 在多模态场景(如图像+文本)中,如何结合多源信息实现预训练数据检测。
  • 3 面对不断变化的预训练数据环境,算法如何保持持续有效。

应用场景

近期应用

版权内容识别

利用MIN-K% PROB检测模型训练中是否包含版权书籍,帮助版权方追踪侵权内容,保障版权权益。

远期愿景

模型透明性与合规

推动行业建立透明数据使用机制,确保模型训练符合隐私和版权法规,促进可信AI发展。

原文摘要

Although large language models (LLMs) are widely deployed, the data used to train them is rarely disclosed. Given the incredible scale of this data, up to trillions of tokens, it is all but certain that it includes potentially problematic text such as copyrighted materials, personally identifiable information, and test data for widely reported reference benchmarks. However, we currently have no way to know which data of these types is included or in what proportions. In this paper, we study the pretraining data detection problem: given a piece of text and black-box access to an LLM without knowing the pretraining data, can we determine if the model was trained on the provided text? To facilitate this study, we introduce a dynamic benchmark WIKIMIA that uses data created before and after model training to support gold truth detection. We also introduce a new detection method Min-K% Prob based on a simple hypothesis: an unseen example is likely to contain a few outlier words with low probabilities under the LLM, while a seen example is less likely to have words with such low probabilities. Min-K% Prob can be applied without any knowledge about the pretraining corpus or any additional training, departing from previous detection methods that require training a reference model on data that is similar to the pretraining data. Moreover, our experiments demonstrate that Min-K% Prob achieves a 7.4% improvement on WIKIMIA over these previous methods. We apply Min-K% Prob to three real-world scenarios, copyrighted book detection, contaminated downstream example detection and privacy auditing of machine unlearning, and find it a consistently effective solution.

cs.CL cs.CR cs.LG