PISCES: Annotation-free Text-to-Video Post-Training via Optimal Transport-Aligned Rewards

TL;DR

PISCES通过双重最优传输奖励实现无标注文本到视频后训练,提升了视频质量和语义一致性。

cs.CV 🔴 高级 2026-02-02 12 次浏览
Minh-Quan Le Gaurav Mittal Cheng Zhao David Gu Dimitris Samaras Mei Chen
文本到视频 无标注 最优传输 奖励机制 后训练

核心发现

方法论

PISCES通过双重最优传输(OT)奖励模块实现无标注的文本到视频后训练。该方法在分布和离散标记层面对齐文本和视频嵌入,提供质量和语义奖励。分布式OT对齐质量奖励关注视觉质量和时间一致性,而离散标记级OT对齐语义奖励则确保文本和视频标记的语义一致性。

关键结果

  • PISCES在VBench上超越了基于标注和无标注的方法,质量和语义得分均有显著提升。
  • 在人类偏好研究中,PISCES在视觉质量和语义一致性方面获得更高的偏好。
  • 双重OT对齐奖励模块与多种优化范式兼容,包括直接反向传播和强化学习微调。

研究意义

PISCES提供了一种无需大规模人类偏好标注的文本到视频后训练方法,解决了现有方法的可扩展性和监督不足问题。通过最优传输对齐奖励信号,该方法在视频生成的视觉质量和语义一致性方面取得了显著进展。

技术贡献

PISCES首次通过最优传输视角改进了生成后训练中的无标注奖励监督。其双重OT对齐奖励模块在分布和离散标记层面对齐文本和视频嵌入,提供了新的理论保证和工程可能性。

新颖性

PISCES是首个在生成后训练中通过最优传输改进无标注奖励监督的方法。与现有方法相比,其在分布和标记层面对齐文本和视频嵌入的创新性显著。

局限性

  • PISCES在处理复杂视频场景时可能存在性能下降的问题,尤其是涉及大量动态元素的场景。
  • 该方法在计算复杂度上仍有提升空间,特别是在大规模数据集上的应用。

未来方向

未来工作可以探索PISCES在更多视频生成任务中的应用,如实时视频生成。此外,进一步优化算法的计算效率和扩展性也是重要的研究方向。

AI 总览摘要

文本到视频(T2V)生成旨在根据输入文本合成高质量、时间一致且语义对齐的视频。然而,现有方法要么依赖大规模人类偏好标注,要么在预训练视觉语言模型的嵌入上操作,导致可扩展性有限或监督效果不佳。PISCES提出了一种无标注的后训练算法,通过双重最优传输(OT)对齐奖励模块解决这些问题。该方法在分布和离散标记层面对齐文本和视频嵌入,提供了质量和语义奖励。实验表明,PISCES在短视频和长视频生成中均优于基于标注和无标注的方法,VBench上的质量和语义得分显著提升,且人类偏好研究进一步验证了其有效性。PISCES的双重OT对齐奖励模块与多种优化范式兼容,包括直接反向传播和强化学习微调,为文本到视频生成提供了新的可能性。尽管如此,PISCES在处理复杂视频场景时可能存在性能下降的问题,未来工作可以探索其在更多视频生成任务中的应用,并进一步优化算法的计算效率和扩展性。

深度分析

研究背景

文本到视频生成是多媒体内容创作中的重要任务,近年来随着扩散模型和视觉语言模型的发展取得了显著进展。然而,现有方法要么依赖大规模人类偏好标注,要么在预训练模型的嵌入上操作,导致可扩展性有限或监督效果不佳。PISCES通过无标注的后训练算法解决了这些问题。

核心问题

现有的文本到视频生成方法在语义对齐和视觉质量上存在挑战,尤其是在缺乏大规模人类偏好标注的情况下。如何在无标注的情况下实现高质量的文本到视频生成是一个重要的研究问题。

核心创新

PISCES的核心创新在于其双重最优传输对齐奖励模块。该模块在分布和离散标记层面对齐文本和视频嵌入,提供了质量和语义奖励。与现有方法相比,PISCES无需大规模人类偏好标注,具有更好的可扩展性。

方法详解

  • �� 使用双重最优传输对齐奖励模块对齐文本和视频嵌入。
  • �� 分布式OT对齐质量奖励关注视觉质量和时间一致性。
  • �� 离散标记级OT对齐语义奖励确保文本和视频标记的语义一致性。
  • �� 兼容多种优化范式,包括直接反向传播和强化学习微调。

实验设计

实验使用了VideoCrafter2和HunyuanVideo数据集,分别代表短视频和长视频设置。评估指标包括VBench上的质量和语义得分,以及人类偏好研究。实验结果表明,PISCES在所有指标上均优于现有方法。

结果分析

PISCES在VBench上的质量和语义得分显著提升,超越了基于标注和无标注的方法。人类偏好研究表明,PISCES在视觉质量和语义一致性方面获得更高的偏好。

应用场景

PISCES可用于多媒体内容创作、机器人和可访问性领域。其无标注的特性使其在大规模应用中具有优势。

局限与展望

PISCES在处理复杂视频场景时可能存在性能下降的问题,尤其是涉及大量动态元素的场景。未来工作可以探索其在更多视频生成任务中的应用,并进一步优化算法的计算效率和扩展性。

通俗解读 非专业人士也能看懂

想象一下你在厨房里做饭。你有一个食谱(文本),需要根据它做出一道美味的菜肴(视频)。PISCES就像一个聪明的厨师助手,它能在不需要你提供详细步骤的情况下,帮助你做出符合食谱要求的菜肴。它通过一种叫做“最优传输”的方法,确保每个食材(文本中的关键词)都能在菜肴中找到合适的位置(视频中的对应片段)。这样,即使你没有详细的烹饪指导(无标注),也能做出美味的菜肴(高质量的视频)。

简单解释 像给14岁少年讲一样

嘿,小伙伴!想象一下你在玩一个游戏,你需要根据任务描述(文本)创建一个虚拟世界(视频)。PISCES就像是你的超级助手,它能帮你在不需要详细指令的情况下,完美地创建出这个世界。它使用一种叫做“最优传输”的魔法,确保每个任务细节都能在世界中找到合适的位置。这样,即使没有详细的任务指令(无标注),你也能创建出一个超棒的虚拟世界!是不是很酷?

术语表

最优传输 (Optimal Transport)

一种数学方法,用于在两个概率分布之间找到最优匹配。

用于对齐文本和视频嵌入。

分布对齐 (Distributional Alignment)

在分布层面对齐不同模态的数据。

用于确保文本和视频的整体视觉质量。

离散标记对齐 (Discrete Token Alignment)

在标记层面对齐不同模态的数据。

用于确保文本和视频的语义一致性。

奖励机制 (Reward Mechanism)

在机器学习中用于指导模型学习的反馈信号。

用于提升视频生成的质量和语义一致性。

后训练 (Post-Training)

在模型初始训练后进行的进一步优化。

用于提升文本到视频生成的效果。

开放问题 这项研究留下的未解疑问

  • 1 如何在不增加计算复杂度的情况下提高PISCES在复杂视频场景中的表现?
  • 2 PISCES在实时视频生成中的应用潜力如何?
  • 3 如何进一步优化PISCES的计算效率以适应大规模数据集?

应用场景

近期应用

多媒体内容创作

PISCES可用于生成高质量的多媒体内容,适用于电影、广告等领域。

远期愿景

实时视频生成

PISCES有潜力用于实时视频生成,需解决计算效率和动态场景适应性问题。

原文摘要

Text-to-video (T2V) generation aims to synthesize videos with high visual quality and temporal consistency that are semantically aligned with input text. Reward-based post-training has emerged as a promising direction to improve the quality and semantic alignment of generated videos. However, recent methods either rely on large-scale human preference annotations or operate on misaligned embeddings from pre-trained vision-language models, leading to limited scalability or suboptimal supervision. We present $\texttt{PISCES}$, an annotation-free post-training algorithm that addresses these limitations via a novel Dual Optimal Transport (OT)-aligned Rewards module. To align reward signals with human judgment, $\texttt{PISCES}$ uses OT to bridge text and video embeddings at both distributional and discrete token levels, enabling reward supervision to fulfill two objectives: (i) a Distributional OT-aligned Quality Reward that captures overall visual quality and temporal coherence; and (ii) a Discrete Token-level OT-aligned Semantic Reward that enforces semantic, spatio-temporal correspondence between text and video tokens. To our knowledge, $\texttt{PISCES}$ is the first to improve annotation-free reward supervision in generative post-training through the lens of OT. Experiments on both short- and long-video generation show that $\texttt{PISCES}$ outperforms both annotation-based and annotation-free methods on VBench across Quality and Semantic scores, with human preference studies further validating its effectiveness. We show that the Dual OT-aligned Rewards module is compatible with multiple optimization paradigms, including direct backpropagation and reinforcement learning fine-tuning. Project page: https://roar-ai.github.io/pisces

cs.CV