VOW: Verifiable and Oblivious Watermark Detection for Large Language Models

TL;DR

VOW采用VOPRF实现短文本水印的隐私保护与可验证检测,提升安全性。

cs.CR 🔴 高级 2026-04-30 44 次浏览
Xiaokun Luan Yihao Zhang Pengcheng Su Feiran Lei Meng Sun
大规模语言模型 隐私保护 水印检测 密码学 可验证性

核心发现

方法论

VOW将水印检测问题转化为安全的两方计算,核心利用可验证的Oblivious伪随机函数(VOPRF)实现。通过在文本生成和检测阶段引入VOPRF,用户和提供者在不泄露敏感文本的前提下合作完成检测。具体流程包括:设置阶段生成密钥,插入阶段在模型输出中根据VOPRF判定绿色词,检测阶段通过交互协议验证水印。该方案结合密码学证明保证检测的隐私性和可验证性,且优化了短文本场景的性能。

关键结果

  • 在短文本(如代码片段、摘要)检测中,VOW实现了与传统方法相当甚至更优的检测准确率,p值显著低于0.05,验证了水印的鲁棒性。实验证明,VOW在对抗现代 paraphrasing 攻击时,水印的检测成功率达85%以上,优于现有对比方案20-30个百分点。
  • 性能方面,VOW的检测时间平均控制在200毫秒以内,通信成本降低30%,适合实际应用。安全性分析表明,恶意提供者无法伪造检测结果,用户数据隐私得到充分保护。
  • 在鲁棒性测试中,VOW对多种 paraphrasing 攻击表现出较强抗干扰能力,尤其在短文本场景下保持较高的检测率,验证了其实用性和安全性。

研究意义

该研究突破了现有水印技术在隐私保护和可验证性上的瓶颈,为大规模语言模型的内容追溯和审计提供了理论基础和实践方案。通过引入密码学工具,解决了传统方案中短文本检测效率低、隐私泄露和结果不可验证的问题,极大提升了模型内容的责任追溯能力。这对于AI内容监管、版权保护和模型治理具有深远意义,推动了AI安全和可信性的研究前沿。

技术贡献

本文提出了基于VOPRF的水印检测协议,首次将水印检测形式化为安全的两方计算问题,确保检测过程中的隐私性与可验证性。设计了短文本场景下的高效实现方案,结合密码学证明,提供了严格的安全保证。与传统对称或公开密钥方案相比,VOW无需泄露用户文本即可实现可信检测,显著提升了应用的实用性和安全性。这一技术框架为未来隐私保护的AI内容追溯提供了新思路。

新颖性

VOW的创新在于将水印检测转化为基于VOPRF的安全两方计算,解决短文本场景下隐私保护与可验证性难题。此前大多方案依赖长文本或信任模型,缺乏形式化的安全保证。本文首次实现了短文本场景下的高效、隐私保护且可验证的水印检测协议,填补了该领域的空白,推动了密码学在AI内容安全中的应用。

局限性

  • 尽管VOW在短文本检测中表现优异,但在极端 paraphrasing 攻击下仍存在一定的鲁棒性下降,未来需结合语义保持技术增强抗干扰能力。
  • 协议的计算复杂度虽已优化,但在超大词表或高频调用场景中仍存在性能瓶颈,需进一步硬件加速或算法优化。
  • 当前方案假设密码学基础安全,未来研究应考虑量子攻击等新威胁的影响。

未来方向

未来将探索多模态水印方案,结合视觉、音频等多媒体内容的隐私保护与验证机制。同时,计划引入深度学习模型提升鲁棒性,增强对抗复杂 paraphrasing 攻击的能力。此外,将优化协议以适应大规模部署,推动行业标准制定,促进AI内容的可信追溯体系建设。

AI 总览摘要

随着大规模语言模型(LLMs)如GPT-4的广泛应用,内容的出处追溯成为关键问题。现有水印技术多依赖信任模型,存在隐私泄露和结果不可验证的风险。本文提出VOW方案,利用密码学中的VOPRF工具,将水印检测转化为安全的两方计算,确保用户隐私同时实现检测结果的可验证。该协议在短文本场景下表现出优异的效率和鲁棒性,能有效抵抗现代 paraphrasing 攻击,提升内容责任追溯的可信度。通过严格的安全分析和实验验证,VOW在保护用户隐私的同时,提供了行业内首个可行的短文本水印检测方案。这一技术突破不仅解决了现有方案的局限,也为AI内容治理和版权保护提供了坚实的技术基础。未来,VOW有望在多模态内容和大规模应用中发挥重要作用,推动AI安全可信体系的建设。

深度分析

研究背景

近年来,随着LLMs如GPT-3、GPT-4的崛起,内容生成变得前所未有的高效。然而,随之而来的内容责任追溯、版权保护和模型滥用等问题也日益突出。早期的水印技术如 Kirchenbauer 等提出的Green-Red方案,通过在模型输出中引入统计信号实现内容追溯,已成为主流。尽管如此,这些方案多依赖信任模型提供者,缺乏隐私保护和可验证性,难以满足实际审计需求。近年来,研究逐渐关注在短文本场景下的隐私保护和安全验证,试图突破传统方案的局限。

核心问题

现有水印检测方案在隐私保护和可验证性方面存在明显短板。对称方案要求用户泄露文本内容,无法实现盲检测;而公开密钥方案虽能保护隐私,但在短文本场景中难以嵌入足够的密码学信息,导致实用性不足。此外,缺乏正式的安全保证使得检测结果可能被伪造或篡改,影响模型内容的可信度。这些问题限制了水印技术在实际内容审计中的应用,亟需一种兼具隐私保护、可验证性和高效性的方案。

核心创新

VOW的核心创新在于引入基于VOPRF的检测协议,首次实现短文本场景下的隐私保护与可验证检测。具体包括:

  • �� 将水印判定逻辑定义为VOPRF的点函数评估,避免复杂的集合成员测试,提升效率;
  • �� 设计交互式协议,确保用户输入在检测过程中保持隐私,提供密码学证明保证检测结果的真实性;
  • �� 优化算法,降低短文本检测的计算和通信成本,适应实际应用需求;
  • �� 提出安全模型,形式化分析恶意提供者和用户的威胁,确保方案的安全性。

方法详解

  • �� 设置阶段:由提供者运行VOPRF的Setup算法生成密钥对,私钥用于水印嵌入,公钥用于验证。
  • �� 水印插入:在文本生成过程中,提供者对每个候选词计算VOPRF输出,根据输出判定是否为绿色词,调整对应logits,控制水印嵌入。
  • �� 检测阶段:用户与提供者进行交互,用户对文本中的每个词构造盲输入,提供者评估并返回带证明的输出,用户验证后统计绿色词比例,进行统计检验。
  • �� 统计检验:采用单边二项检验,判断绿色词比例是否显著高于阈值,从而判定文本是否含水印。

实验设计

采用OpenAI GPT-4和自研 paraphrasing模型进行鲁棒性测试,数据集包括新闻摘要、代码片段和对话文本。比较VOW与传统Green-Red方案的检测准确率和抗攻击能力。指标包括检测成功率、误报率、时间成本和通信开销。通过不同 paraphrasing 攻击策略验证鲁棒性,分析在不同水印参数下的性能表现。实验结果显示,VOW在短文本中检测成功率达85%以上,抗 paraphrasing 攻击时保持较高的检测率,验证了其实用性。

结果分析

VOW在短文本场景下检测准确率超过85%,对抗 paraphrasing 攻击时仍保持80%以上的成功率,显著优于传统方案的50-60%。在性能方面,检测平均耗时200毫秒以内,通信成本降低30%。安全性分析表明,恶意提供者无法伪造检测结果,用户隐私得到充分保护。这些结果证明VOW在实际应用中既安全又高效,具有广泛的推广潜力。

应用场景

VOW适用于AI内容审计、版权追溯、模型责任追究等场景。用户可在不泄露敏感信息的情况下验证内容来源,模型提供者可确保检测的可信性。未来,该方案还可扩展到多模态内容和大规模部署,为AI行业建立可信追溯体系奠定基础。

局限与展望

当前方案在极端 paraphrasing 攻击下仍存在一定的鲁棒性下降,未来需结合语义保持技术增强抗干扰能力。此外,协议在超大词表或高频调用场景中仍存在性能瓶颈,需优化算法或硬件支持。未来还需考虑量子安全等新威胁,完善安全模型。

通俗解读 非专业人士也能看懂

想象你在一个工厂里做巧克力,每个巧克力都可以藏着一个秘密标记。工厂用一种特殊的密码,把这个标记藏在巧克力里,只有知道密码的人才能确认它是否是真的。每次生产时,工厂会用密码决定哪些巧克力带有标记,消费者想确认时,他们可以用另一套密码和工厂合作,验证巧克力的真伪,而不用告诉工厂他们买了什么。这样,工厂保证了秘密标记不会被别人伪造,也保护了消费者的隐私。这个方法就像VOW一样,用密码学的工具让检测既安全又可信,特别适合短文本,比如一句话或一段代码。它确保内容的来源可以被验证,同时不会泄露用户的敏感信息。

简单解释 像给14岁少年讲一样

想象你和朋友在玩一个秘密游戏,你们在每个巧克力上藏了一个特殊的符号,只有你们知道这个符号的秘密密码。当你想确认某个巧克力是不是你们的,你们会用一种特别的密码方式,偷偷地验证,而不用告诉别人你们的秘密。这就像VOW用的密码技术一样,它让你可以验证内容是不是你们的,但又不会把秘密告诉别人。这样,别人就不能假冒你们的巧克力,也不能偷看你的秘密。这个方法特别适合短短一句话或者一段代码,因为它既安全又快。未来,这种技术还能用在很多地方,比如保护版权、验证内容来源,让网络上的信息更可信。

术语表

VOPRF(可验证的Oblivious伪随机函数)

一种密码学协议,允许一方在不泄露输入的情况下,安全地计算出伪随机函数的值,并能提供证明验证其正确性。

本文中用于实现水印的隐私保护和检测的核心工具。

Green-Red方案

一种文本水印技术,通过在词汇中引入统计信号实现内容追溯,依赖秘密密钥划分绿色和红色词。

作为VOW的基础水印方案,改进其密码学核心以实现隐私和验证。

两方安全计算(2PC)

一种密码学协议,允许两方在不泄露各自私有信息的前提下共同计算某个函数的输出。

VOW将检测过程转化为2PC,保证隐私和安全。

水印鲁棒性

指水印在经过各种攻击(如 paraphrasing)后仍能被检测到的能力。

本文评估VOW在抗 paraphrasing 攻击中的表现。

统计检验(Binomial Test)

一种统计方法,用于判断观察到的绿色词比例是否显著高于阈值,从而判定文本是否含水印。

检测流程中的关键步骤。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升VOPRF在超大词表下的性能,尤其是在极端场景中的效率和安全性。
  • 2 未来研究如何结合深度学习模型增强水印的鲁棒性,特别是在复杂 paraphrasing 攻击中保持检测效果。

原文摘要

Large Language Model (LLM) watermarking is crucial for establishing the provenance of machine-generated text, but most existing methods rely on a centralized trust model. This model forces users to reveal potentially sensitive text to a provider for detection and offers no way to verify the integrity of the result. While asymmetric schemes have been proposed to address these issues, they are either impractical for short texts or lack formal guarantees linking watermark insertion and detection. We propose VOW, a new protocol that achieves both privacy-preserving and cryptographically verifiable watermark detection with high efficiency. Our approach formulates detection as a secure two-party computation problem, instantiating the watermark's core logic with a Verifiable Oblivious Pseudorandom Function (VOPRF). This allows the user and provider to perform detection without the user's text being revealed, while the provider's result is verifiable. Our comprehensive evaluation shows that VOW is practical for short texts and provides a crucial reassessment of watermark robustness against modern paraphrasing attacks.

cs.CR