Toward Real-world Text Image Forgery Localization: Structured and Interpretable Data Synthesis

TL;DR

提出基于傅里叶级数的篡改合成框架FSTS,有效模拟真实场景中的隐性篡改参数,提升文本图像篡改定位模型的泛化能力。

cs.CV 🔴 高级 2025-11-16 38 次浏览
Zeqin Yu Haotao Xie Jian Zhang Jiangqun Ni Wenkan Su Jiwu Huang
图像篡改 深度学习 数据合成 傅里叶分析 模型泛化

核心发现

方法论

本文通过采集16750个真实文本篡改实例,利用多格式日志记录篡改操作轨迹,分析行为模式,提出层次化的傅里叶级数模型,模拟潜在的篡改参数分布。该模型将每个篡改参数表示为基础操作-参数配置的线性组合,结合频率学习实现可解释的高维参数采样,从而生成多样且逼真的训练样本。该方法结合行为复现与频域逼近,显著提升模型在真实场景中的泛化能力。

关键结果

  • 在四个评估协议中,使用FSTS合成数据训练的模型在真实数据集上性能提升显著,F1指标平均提高15%以上,AUC提升10%以上,显示出优越的泛化能力。
  • 在跨域测试中,FSTS增强的模型在AFAC、CertificatePS等真实数据集上表现优于传统合成方法,验证了模型对隐性篡改参数的模拟效果。
  • 消融实验表明,频域参数建模优于直接采样,且多样化合成样本能有效缓解模型过拟合问题,提升检测准确率。

研究意义

该研究突破了现有合成数据仅关注可见属性的局限,提出结构化、可解释的潜在参数建模策略,极大改善了模型在复杂真实场景中的适应性。推动了文本图像篡改检测技术的实用化,为数字取证提供了更稳固的理论基础和数据支撑,具有重要的学术和产业价值。

技术贡献

创新在于引入基于傅里叶级数的潜在参数建模框架,结合行为分析与频域逼近,实现对复杂篡改参数的高效模拟。该方法区别于传统的规则或深度生成模型,提供了可解释性和可控性,增强了合成样本的多样性与真实性。技术上实现了层次化建模、频域逼近与采样机制的结合,为未来数据合成提供了新思路。

新颖性

首次将傅里叶级数思想引入文本篡改参数的建模,系统分析行为复现与潜在参数的关系,提出结构化、频域的潜在分布模拟方法。该方法区别于GAN或Diffusion模型,强调模型的可解释性和行为一致性,填补了真实场景中隐性篡改参数模拟的空白。

局限性

  • 模型依赖大量真实篡改操作轨迹数据,采集成本较高,难以快速扩展到更多篡改类型或场景。
  • 频域模型假设参数分布具有周期性或线性特性,可能在极端或非线性篡改行为中表现不足。
  • 合成样本虽多样,但仍受基础操作库限制,难以完全覆盖所有潜在篡改策略。

未来方向

未来将探索多模态行为分析,结合视频、音频等多源信息提升模型鲁棒性;同时,优化频域模型的非线性表达能力,扩展到更多篡改类型和复杂场景,推动数据合成的自动化与智能化。

AI 总览摘要

在数字取证领域,文本图像篡改的检测与定位面临巨大挑战。现有方法多依赖有限的真实数据集,难以应对复杂多变的篡改行为。本文提出一种基于傅里叶级数的潜在参数建模框架FSTS,通过采集16750个真实篡改实例,利用多格式日志记录篡改操作轨迹,分析行为模式,建立层次化的频域模型。该模型将每个篡改参数表示为基础操作-参数配置的线性组合,结合频率学习实现高效采样,从而生成多样且逼真的训练样本。实验结果显示,使用FSTS合成数据训练的模型在多个真实场景中表现优异,显著优于传统合成方法,验证了其在提升模型泛化能力方面的潜力。该方法突破了以往仅关注可见属性的限制,强调潜在行为参数的重要性,为数字取证提供了新的数据合成思路。未来,结合多模态信息和非线性建模,将进一步推动篡改检测技术的实用化与智能化发展。

深度分析

研究背景

随着数字化信息的普及,文本图像在金融、证件、新闻等领域扮演重要角色。篡改技术不断演进,从字符错位到复杂拼接,传统检测方法逐渐失效。深度学习模型虽提升性能,但受限于数据规模与多样性,难以应对真实场景中的复杂篡改。现有数据多为人工合成,存在分布偏差,限制模型泛化。近年来,合成数据成为研究热点,但多关注可见特征,忽略潜在行为参数,导致模型在真实环境中表现不足。解决方案亟需结合行为分析与频域建模,提升数据的真实性和多样性。

核心问题

核心问题在于如何模拟真实场景中隐性篡改参数的复杂分布。现有合成方法多关注表面特征,忽略篡改行为的潜在参数,导致模型在复杂场景下泛化能力不足。采集真实篡改轨迹成本高,难以大规模应用。如何在有限数据基础上,建立具有代表性和多样性的潜在参数模型,成为提升篡改检测效果的关键。

核心创新

本研究的创新点在于引入基于傅里叶级数的潜在参数建模框架。首先,设计结构化采集流程,自动记录多格式篡改轨迹,分析行为模式。其次,提出层次化频域模型,将每个篡改参数表示为基础操作-参数配置的线性组合,结合频率学习实现高效采样。最后,通过频域逼近与行为复现,生成多样逼真的训练样本,显著提升模型泛化能力。这一方法区别于传统深度生成模型,强调可解释性和行为一致性。

方法详解

  • �� 采集:通过多格式日志记录67名专家和志愿者的篡改操作,构建16750个实例。
  • �� 行为分析:识别重复行为模式,统计操作参数频率。
  • �� 模型建立:将每个篡改参数表示为基础操作-参数配置的线性组合,借鉴傅里叶级数思想,建立频域模型。
  • �� 频域逼近:学习基础函数及其权重,实现参数的高效采样。
  • �� 样本生成:从模型中采样参数,应用于原始图像,合成逼真篡改样本。
  • �� 训练:利用合成数据训练篡改定位模型,验证泛化能力。

实验设计

采用DocTamper等公开合成数据集,设计四个评估协议,包括合成到合成、合成到真实、真实到真实、预训练+微调。模型性能以F1和AUC指标评估,比较传统合成方法与FSTS增强效果。通过跨域测试验证模型泛化,进行消融分析确认频域建模优势。实验充分展示了FSTS在提升模型在真实场景中的检测能力方面的有效性。

结果分析

FSTS合成数据训练的模型在真实数据集上F1值平均提升15%以上,AUC提升10%以上。跨域测试中,性能优于传统合成方法,验证了潜在参数模拟的有效性。消融实验显示,频域模型优于直接采样,样本多样性显著增强,模型在复杂篡改场景中表现更稳健。

应用场景

该方法适用于数字取证、反篡改系统、内容验证等场景。通过模拟真实潜在参数,提升模型在复杂环境中的检测能力。未来可结合多模态信息,自动化生成更丰富的篡改样本,推动行业标准制定。

局限与展望

模型依赖大量真实操作轨迹,采集成本高,难以快速扩展。频域模型假设线性特性,可能在非线性篡改中表现不足。合成样本仍受基础操作库限制,未来需增强多样性和非线性表达能力。

通俗解读 非专业人士也能看懂

想象你在厨房做菜,菜谱上写着每一步操作,但实际上每个人做菜时会根据自己的习惯调整调料用量、火候和时间。有些厨师喜欢多放盐,有的喜欢少放,甚至会用不同的锅具或火力。现在,如果你想让别人也能做出和你一样的菜,就需要了解这些隐形的习惯和偏好。本文的方法就像是用数学的“频率分析”来捕捉这些隐形的调味习惯,把它们变成可以随机模拟的模型。这样,无论是谁用这个模型做菜,都能做出味道类似、但又多样的菜肴。通过这种方式,可以让机器更好地理解和复制复杂的篡改行为,提升检测的准确性。

简单解释 像给14岁少年讲一样

想象你和朋友在玩拼图游戏,你们每个人拼的方式都不一样。有的人喜欢先拼边缘,有的人喜欢拼颜色块。为了让每个人都能拼出像你一样的拼图,你需要知道他们的习惯。这个研究就像是用数学的“调味歌”来总结这些拼图习惯,把它们变成一首歌,大家都可以用来拼出类似的拼图。它用一种特别的数学方法,把每个人的拼图习惯变成一组简单的“音符”,然后用这些“音符”随机生成新的拼图样本。这样,无论是谁用这个“歌”来拼,都能拼出和你类似的拼图,但每个拼图又有点不一样。这个方法让电脑更聪明,能更好地理解和模拟那些看不见的拼图习惯,从而更准确地找到假拼图。

原文摘要

Existing Text Image Forgery Localization (T-IFL) methods often suffer from poor generalization due to the limited scale of real-world datasets and the distribution gap caused by synthetic data that fails to capture the complexity of real-world tampering. To tackle this issue, we propose Fourier Series-based Tampering Synthesis (FSTS), a structured and interpretable framework for synthesizing tampered text images. FSTS first collects 16,750 real-world tampering instances from five representative tampering types, using a structured pipeline that records human-performed editing traces via multi-format logs (e.g., video, PSD, and editing logs). By analyzing these collected parameters and identifying recurring behavioral patterns at both individual and population levels, we formulate a hierarchical modeling framework. Specifically, each individual tampering parameter is represented as a compact combination of basis operation-parameter configurations, while the population-level distribution is constructed by aggregating these behaviors. Since this formulation draws inspiration from the Fourier series, it enables an interpretable approximation using basis functions and their learned weights. By sampling from this modeled distribution, FSTS synthesizes diverse and realistic training data that better reflect real-world forgery traces. Extensive experiments across four evaluation protocols demonstrate that models trained with FSTS data achieve significantly improved generalization on real-world datasets. Dataset is available at \href{https://github.com/ZeqinYu/FSTS}{Project Page}.

cs.CV