Plan-and-Verify Video Reward Reasoning with Spatio-Temporal Scene Graph Grounding

TL;DR

SG-PVR模型通过时空场景图提升文本到视频生成的语义对齐。

cs.CV 🔴 高级 2026-06-10 6 次浏览
Hyomin Kim Junghye Kim Joanie Hayoun Chung Yoonjin Oh Kyungjae Lee Sungbin Lim Sungwoong Kim
视频生成 奖励模型 时空场景图 语义对齐 深度学习

核心发现

方法论

SG-PVR模型通过计划与验证的推理结构,利用时空场景图来确保视频生成与文本提示的细粒度语义对齐。该方法将提示分解为原子性声明,并对每个声明进行验证,确保所有要求都被检查。

关键结果

  • 在VSB-v2数据集上,SG-PVR在视觉、物理和对齐精度上分别达到43.6%、38.2%和39.8%。
  • 在时间语义测试集上,SG-PVR的整体准确率达到31.4%,优于其他方法。
  • 在T2V-CompBench测试中,SG-PVR在一致性属性、动态属性等维度上表现优异。

研究意义

SG-PVR通过引入时空场景图,显著提升了文本到视频生成的语义对齐能力,解决了现有模型在复杂时间语义和事件顺序上的不足,为视频生成领域提供了新的解决方案。

技术贡献

SG-PVR在视频奖励建模中引入了时空场景图作为结构化中间表示,与传统的自由形式推理模型相比,提供了更精确的语义对齐和验证机制。

新颖性

SG-PVR首次将时空场景图应用于视频奖励模型中,通过计划与验证的推理结构,解决了现有模型在复杂时间语义对齐上的不足。

局限性

  • 模型在处理极端复杂的场景时可能会出现性能下降。
  • 对场景图的生成质量依赖较大。

未来方向

未来工作可以探索更复杂的场景图生成技术,以及在更大规模数据集上的应用。

AI 总览摘要

现有的文本到视频生成模型在细粒度语义对齐上存在不足,特别是在复杂时间语义和事件顺序的处理上。SG-PVR模型通过引入时空场景图和计划与验证的推理结构,有效解决了这些问题。

SG-PVR将文本提示分解为原子性声明,并通过时空场景图验证每个声明,确保所有要求都被检查。实验结果表明,SG-PVR在多个基准测试中表现优异,尤其是在VSB-v2数据集上的视觉、物理和对齐精度上。

尽管SG-PVR在语义对齐上取得了显著进展,但在处理极端复杂场景时仍存在一定局限。未来的研究可以进一步优化场景图生成技术,并探索其在更大规模数据集上的应用潜力。

深度分析

研究背景

文本到视频生成技术近年来取得了显著进展,尤其是基于扩散变换器的模型。然而,这些模型在细粒度语义对齐上仍存在不足,特别是在处理复杂的时间语义和事件顺序时。

核心问题

现有的奖励模型在文本到视频生成中无法有效处理复杂的时间语义和事件顺序,导致生成的视频与文本提示的语义对齐度不高。

核心创新

SG-PVR通过引入时空场景图和计划与验证的推理结构,解决了现有模型在复杂时间语义对齐上的不足。时空场景图提供了结构化的视觉证据,使得每个原子性声明都能被精确验证。

方法详解

  • �� 提取时空场景图:从视频中提取实体、属性和时间关系。
  • �� 生成验证计划:将文本提示分解为原子性声明。
  • �� 验证声明:对每个声明进行验证,使用视频和场景图作为证据。
  • �� 聚合得分:根据验证结果生成语义对齐得分。

实验设计

实验在VSB-v2、LGVQ和MJ-Bench等数据集上进行,评估了模型在视觉、物理和对齐精度上的表现。还进行了消融实验以验证模型的有效性。

结果分析

SG-PVR在VSB-v2数据集上的视觉、物理和对齐精度分别达到43.6%、38.2%和39.8%。在时间语义测试集上,整体准确率为31.4%。

应用场景

SG-PVR可用于提升文本到视频生成的语义对齐度,特别是在需要精确时间语义和事件顺序的应用场景中,如影视制作和虚拟现实。

局限与展望

模型在处理极端复杂的场景时可能会出现性能下降,对场景图的生成质量依赖较大。未来研究可探索更复杂的场景图生成技术。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你有一个食谱(文本提示),需要按照步骤(原子性声明)来做菜。你用一个清单(时空场景图)来确保每个步骤都被正确执行。SG-PVR就像是一个聪明的助手,帮助你检查每个步骤是否都按照食谱完成,并确保所有食材(视频内容)都在正确的位置和时间出现。

简单解释 像给14岁少年讲一样

想象你在玩一个视频游戏,你需要根据提示完成任务。SG-PVR就像是游戏中的助手,帮你检查每个任务是否完成,并确保你在正确的时间和地点做正确的事情。它就像是游戏中的小精灵,帮你找到所有隐藏的线索,让你顺利通关!

术语表

时空场景图 (Spatio-Temporal Scene Graph)

一种结构化表示,包含视频中的实体、属性和时间关系。

用于验证视频内容与文本提示的语义对齐。

原子性声明 (Atomic Claim)

从文本提示中分解出的单一语义要求。

用于计划与验证推理结构中的验证计划。

计划与验证 (Plan-and-Verify)

一种推理结构,先生成验证计划,再逐个验证声明。

用于确保视频生成的细粒度语义对齐。

语义对齐 (Semantic Alignment)

视频内容与文本提示在语义上的一致性。

SG-PVR的主要评估指标之一。

奖励模型 (Reward Model)

用于指导文本到视频生成后训练的模型。

SG-PVR通过奖励模型提升语义对齐度。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂的场景中生成高质量的时空场景图?
  • 2 如何在更大规模的数据集上验证SG-PVR的有效性?

应用场景

近期应用

影视制作

帮助导演和制片人生成与剧本高度一致的视频内容。

远期愿景

虚拟现实

提升虚拟现实体验的沉浸感和真实性,适用于教育和娱乐领域。

原文摘要

Reward models for text-to-video (T2V) generation guide post-training but often fail at fine-grained semantic alignment. We trace this to two structural weaknesses in existing reasoning-based reward models: they do not systematically verify every condition described in the prompt, and the visual evidence supporting each judgment remains implicit in their free-form reasoning. We propose SG-PVR, a video reward model that addresses these limitations through plan-and-verify reasoning grounded in spatio-temporal scene graphs. The verification plan decomposes the prompt into atomic claims, ensuring every requirement is checked. The spatio-temporal scene graph, encoding entities, attributes, and temporally-grounded relations, is extracted from the video and maintained as a persistent structured visual reference throughout reasoning. Each claim is verified against both the video and the scene graph, anchoring judgments in explicit visual evidence. SG-PVR achieves strong performance on semantic alignment, including fine-grained temporal semantics. As a test-time reranker, it further enhances compositional alignment in T2V generation.

cs.CV