Retrieval-Driven Training-Free AI-Generated Video Attribution

TL;DR

AOCT-MSQR检索框架免训练实现视频溯源,GenVidBench达20.5% Rank-1、16.6% mAP。

cs.CV 🔴 高级 2026-07-31 17 次浏览
Renxi Cheng Chaolei Han Jie Gui Hongsong Wang
视频生成取证 开放集归因 实例检索 生成指纹 免训练学习

核心发现

方法论

论文将视频归因从封闭集分类改写为参考库上的实例检索。流程依次使用自适应正交颜色变换AOCT、多尺度量化残差MSQR,以及空间残差、时间差分和RGB语义流的加权聚合,最后由Kinetics-400预训练R3D-18提取特征,并以余弦相似度完成归因或检测。

关键结果

  • 在GenVidBench的100-shot归因设置中,方法平均Rank-1为84.6%、mAP为78.3%;1-shot仍达到32.8%和52.0%,说明少量参考样本也能形成可用生成指纹。
  • 100-shot检测平均准确率为91.0%,高于PiD的90.2%、LOTA的87.3%和UNITE的82.2%;在T2V-Zero、ModelScope、VideoCrafter2上分别达到100%,体现跨生成器稳定性。
  • 消融实验中,基础R3D-18平均Rank-1为51.1%;加入AOCT、MSQR、时间流后分别升至62.0%、66.8%和73.8%,三者加RGB融合达到最佳平均结果。

研究意义

该工作回应了视频生成器快速迭代、标注数据昂贵以及封闭集分类难以识别新模型的长期痛点。参考视频可直接注册新生成器,无需重新训练分类器;检索到的样本还提供了较直观的证据链。对平台审核、数字取证和监管而言,它把“是否伪造”推进到“来自哪个生成源”。

技术贡献

AOCT从局部均值残差的协方差矩阵最大特征向量出发,经单纯形约束与Gram-Schmidt正交化构造稳定颜色基;MSQR在多个通道非对称量化尺度上计算反演残差;时间流使用相邻残差差分捕获闪烁和不自然运动。最终按0.6、0.3、0.1融合空间、时间与RGB流,形成无需任务训练的指纹表示。

新颖性

核心新意不是训练更大的分类器,而是重新定义任务:生成器归因本质上是源指纹匹配。相较VGMShield、SAGA等监督式视频归因,以及ESSP、LOTA、PiD等图像残差方法,本文首次系统地将自适应颜色空间、多尺度量化和视频时间语义聚合组合为开放集、免训练检索管线。

局限性

  • 实验主要覆盖GenVidBench中的八个生成器和特定真实视频;面对未注册生成器、强压缩、裁剪、重编码或多次编辑,指纹相似度可能下降。
  • 方法仍依赖参考库质量与预训练R3D-18;库中样本分布、语义偏差和生成器版本变化可能造成错误匹配,且论文未给出完整的计算开销与跨数据集测试。

未来方向

后续可扩大真实世界扰动和未见生成器测试,研究开放集拒识、检索置信度与校准;可结合更强视频编码器、局部区域检索和压缩不变指纹,并建立带时间戳、来源证明和可审计证据的取证数据库。

AI 总览摘要

逼真的文本生成视频正在削弱传统“看起来是否真实”的判断能力。现有检测器多做二分类,监督式归因器则依赖昂贵标注并局限于训练时见过的生成器;新模型出现后,往往必须重新训练。论文因此把问题改写为实例检索:查询视频应匹配参考库中最相似的生成器指纹。

方法名为Retrieval-Driven Training-Free AI-Generated Video Attribution。它先用AOCT依据高频残差自适应旋转RGB通道,再通过MSQR在多尺度、通道非对称量化下提取细微残差;随后融合空间残差、相邻帧时间差分和RGB语义流,权重为0.6、0.3、0.1,并交给Kinetics-400预训练R3D-18编码。新生成器只需注册参考样本,不需模型更新。

在GenVidBench上,100-shot归因平均Rank-1/mAP为84.6%/78.3%,检测准确率为91.0%;1-shot归因仍为32.8%/52.0%。消融显示AOCT、MSQR和时间流逐步将平均Rank-1从51.1%提升至73.8%。该方案更适合作为可扩展取证基础,但仍需验证压缩、编辑、未注册模型和跨数据集泛化。

深度分析

研究背景

视频生成器如T2V-Zero、ModelScope、VideoCrafter2、Pika、SVD、MuseV、Mora和CogVideo不断提升视觉质量。现有检测研究利用空间、频率、光流或长时序建模,但多数只判断真假;VGMShield、SAGA等归因方法依赖监督训练。生成模型虽保持语义,却常留下低层统计不一致,为源识别提供了可能。

核心问题

目标是在候选源可扩展、样本稀缺且生成器持续变化的条件下,判断视频来自哪个生成器,并兼顾真实视频检测。难点在于生成器指纹细微、语义内容会掩盖差异,视频还存在帧间依赖;封闭集分类无法自然处理新源,单帧图像特征也难表达时间伪影。

核心创新

第一,将归因定义为参考库检索而非类别预测,实现开放集扩展。第二,AOCT以高频残差协方差学习正交颜色基,避免固定颜色空间丢失信号。第三,MSQR采用多尺度、通道非对称量化并逆变换生成残差。第四,以时间差分捕获闪烁和运动不连续,并保留RGB语义作为上下文。

方法详解

  • �� 输入:每段视频采样64帧并缩放至224×224,不足帧数时循环填充。
  • �� AOCT:令E=I-I*K,K为3×3均值滤波器;计算Σ=(1/N)E♭E♭ᵀ,取最大特征向量,经投影ΠC和Gram-Schmidt得到M,输出Y=I×3M。
  • �� MSQR:按尺度S(i)量化Y,得到Ŷ(i)=round(Y/S(i))S(i),再计算R(i)=I-M⁻¹Ŷ(i),平均获得R。
  • �� 聚合:构造ΔR_t=r_{t+1}-r_t,按F=0.6R+0.3ΔR+0.1I融合。
  • �� 检索:R3D-18提取特征,数据库与查询视频用余弦相似度匹配。

实验设计

GenVidBench包含HD-VG、Vript真实视频,以及八个生成源:T2V-Zero、ModelScope、VideoCrafter2、Pika、SVD、MuseV、Mora、CogVideo。比较ResNet-50、R3D-18、ESSP、LOTA、PiD、DeMamba和UNITE;评价归因Rank-1、mAP,检测用准确率。设置1-shot、10-shot、100-shot,并进行AOCT、MSQR、时间流消融。

结果分析

100-shot时方法平均归因84.6% Rank-1、78.3% mAP,检测91.0%;在CogVideo归因达99.5%/95.0%。1-shot平均归因32.8%/52.0%,优于多数基线。消融平均Rank-1从无模块的51.1%升至AOCT后62.0%、加MSQR后66.8%、加时间流后73.8%,说明空间、量化和动态信息互补。

应用场景

平台可将已知生成器样本登记为参考库,对上传视频同时进行真假判断和来源排序;执法机构可保存检索到的相似样本作为辅助证据。部署前需要覆盖目标平台的压缩、分辨率和生成器版本,并设置未知源拒识机制,避免把新模型错误归入旧类别。

局限与展望

当前证据主要来自单一基准和八个生成器,不能证明对所有视频模型、真实拍摄条件和攻击扰动均稳健。R3D-18虽免任务训练,却仍需预训练模型和逐库比对;大规模库会增加检索成本。未来应加入近邻搜索、扰动增强、开放集校准、多模态来源证据及跨数据集评测。

通俗解读 非专业人士也能看懂

把每个视频生成器想成一家蛋糕工厂。不同工厂都能做出“橙色南瓜放在白盘上”的蛋糕,外观和主题几乎一样,但机器留下的纹理、边缘和颜色抖动会略有不同。论文不是训练一个只会说“这是甲厂或乙厂”的裁判,而是给每家工厂保存几块样品,遇到新蛋糕就比较它与样品的相似程度。

首先,系统把普通颜色换成更容易看出细小差别的观察角度;然后反复用粗细不同的筛子处理图像,留下不容易被大面积颜色遮住的小纹理。接着比较相邻画面,看背景颜色是否突然跳动、边缘是否闪烁。最后把纹理、变化和整体内容合在一起,交给一个已经看过大量视频的编码器做“指纹”。

这样,新工厂加入时只要提供样品,不必重新教会整个系统。它还能把真实视频与所有已登记样品都判得很不像,从而辅助检测。但如果视频被严重压缩、裁剪,或来自完全没登记的工厂,判断仍可能不可靠。

简单解释 像给14岁少年讲一样

想象你在学校侦查谁做了一个假游戏视频。八个同学都能用不同软件做出“汽车冲过荒野”的画面,普通人只看剧情,很难分辨。可是每个软件都有小习惯:有人让边缘发亮,有人让背景颜色抖一下,有人留下方块状小瑕疵。

这篇论文的办法像给每个软件建立“笔迹样本”。它先把视频拆成连续画面,再放大平时不容易注意的细小差别;接着检查前后画面有没有奇怪跳动。系统还保留原来的场景内容,免得把“汽车”本身误认为软件特征。所有信息合成后,就和样本库逐个比较。

酷的是,它不是死记一张固定名单。新软件来了,只要上传一些参考视频就能加入。实验中,100个参考样本设置下,平均一次猜中来源84.6%,检测真假准确率91.0%;只有一个参考样本时,来源首选准确率也有32.8%。当然,视频被压得很糊、剪得很碎,或者软件从没登记过,系统就可能猜错。

术语表

Generative fingerprint(生成指纹)

生成器在视频中留下的稳定、细微统计痕迹。它不是可见水印,而是由生成过程产生的空间和时间模式。

论文用残差表示捕获不同模型的指纹并进行检索。

AOCT(自适应正交颜色变换)

依据高频残差协方差学习颜色变换矩阵,并通过正交约束保持稳定性。其第一基向量由最大特征向量确定。

用于把RGB帧投影到更容易暴露生成伪影的颜色空间。

MSQR(多尺度量化残差)

在多个量化尺度下离散化颜色变换后的帧,再逆变换并与原帧相减。该过程突出细粒度差异。

论文使用四组通道尺度生成并平均残差。

Temporal residual(时间残差)

相邻残差帧之间的差分,用于表示随时间发生的异常变化。它尤其敏感于闪烁和不自然动态。

作为第三类信息流参与最终加权融合。

Instance retrieval(实例检索)

将查询样本与数据库实例按特征相似度排序,而非预测固定类别。它天然支持新增类别。

论文以余弦相似度完成生成器归因和检测。

开放问题 这项研究留下的未解疑问

  • 1 未注册生成器能否被可靠拒识仍不明确;需要开放集阈值、置信度校准和更多新模型测试。
  • 2 社交平台压缩、裁剪、滤镜及多次转码会如何改变指纹尚缺系统曲线;应建立扰动基准。
  • 3 参考库扩大后的速度、隐私和证据可审计性仍待研究,尤其是跨平台部署。

应用场景

近期应用

平台内容审核

平台可为已知生成器收集少量参考视频,采用AOCT-MSQR管线生成库特征,对上传内容进行余弦检索,同时输出真假判断和来源排名。

数字取证辅助

调查人员可将查询视频与登记样本及残差可视化结果一起保存,作为判断生成来源的辅助证据;正式结论仍需结合元数据和人工鉴定。

远期愿景

可审计的生成内容登记网络

未来可把生成器版本、参考样本、时间戳和检索证据纳入共享数据库,形成跨平台的来源追踪基础设施,但需解决隐私、标准和对抗攻击问题。

原文摘要

AI-generated videos are becoming increasingly realistic and difficult to distinguish from authentic ones, which facilitates malicious misuse and poses growing threats to cybersecurity and social governance. Attributing AI-generated videos to their specific generative sources is therefore of critical importance for forensic investigation and legal regulation. However, most existing visual attribution methods focus on images and particularly rely on the image generation model, thereby lacking the ability to generalize to large-scale AI-generated video data. To address these limitations, we introduce an training-free AI-generated video attribution paradigm. Specifically, we formulates AI-generated video attribution as an instance retrieval task, and design a generative fingerprint-based pipeline. This pipeline consists of an adapted orthogonal color transformation, multi-scale quantized residual generation, and temporal-semantic aggregation, progressively capturing and integrating artifacts introduced by generative models across video frames. Extensive experiments on the GenVidBench benchmark demonstrate that our method achieves strong performance in both AI-generated video detection and attribution, outperforming existing state-of-the-art methods with a Rank-1 accuracy of 20.5% and a mean Average Precision of 16.6%. The code is at https://github.com/renxi-seu/Video_Attribution.

cs.CV cs.AI