FETV: A Benchmark for Fine-Grained Evaluation of Open-Domain Text-to-Video Generation

TL;DR

提出FETV基准,基于多维类别和时序信息对开源T2V模型进行细粒度评估,揭示自动指标与人类评价偏差。

cs.CV 🔴 高级 2023-11-03 35 次浏览
Yuanxin Liu Lei Li Shuhuai Ren Rundong Gao Shicheng Li Sishuo Chen Xu Sun Lu Hou
文本到视频 评估基准 多维分类 自动指标 时序感知

核心发现

方法论

FETV采用三正交维度:主要内容、属性控制和复杂度,结合空间与时间类别,构建多层次文本提示分类体系。通过自动匹配与人工校正,收集619个多类别提示。对四个代表性T2V模型进行手动评估,分析其在不同类别中的优劣。利用FETV作为测试平台,评估自动指标(如CLIPScore、FVD)与人类评价的相关性,发现现有指标相关性较差。基于大规模视觉-语言模型(如UMT),提出改进指标FVD-UMT和UMTScore,显著提升与人类评价的相关性。

关键结果

  • 在空间类别中,人物与动物视频质量较差,水与景物较优;动作与运动类别视频质量明显低于静态内容。模型如Text2Video-zero在静态质量上表现优异,但在动态和时序连贯性方面明显不足。自动指标(如FVD、CLIPScore)与人类评价相关性低(Kendall τc约0.2-0.3),通过引入UMT模型,相关性提升至0.6以上。模型在控制运动方向、事件顺序等属性方面表现欠佳,反映出当前模型在复杂时序内容生成上的局限。
  • 结果显示,FETV提供了比传统指标更细粒度的性能分析工具,有助于揭示模型在不同内容和属性控制上的差异,为未来模型优化提供指导。
  • 通过多维类别分析,明确指出模型在高频细节和复杂运动内容上的不足,强调需要结合时序感知与细粒度控制的生成技术。

研究意义

该研究填补了T2V模型定量评估中缺乏细粒度、多维类别分析的空白,为模型性能的全面理解提供了新工具。FETV通过多角度分类体系,揭示模型在不同内容、属性和复杂度场景下的表现差异,有助于推动生成模型在真实应用中的可靠性和 controllability。其引入的时序类别,强化了对视频动态内容的评估能力,符合视频生成的核心需求。通过自动指标的优化,推动了自动评估技术的进步,减少了对昂贵人工标注的依赖,为行业标准制定提供了理论基础。整体上,该工作为开源T2V模型的性能分析与优化提供了系统性框架,具有重要的学术和产业价值。

技术贡献

本研究提出了多维、多层次的FETV评估体系,结合空间与时间类别,创新性地引入了时序感知类别,提升了对动态视频内容的评估能力。通过自动匹配与人工校正相结合的方法,建立了丰富的多类别文本提示库,为细粒度评估提供基础。基于大规模视觉-语言模型(如UMT),开发了新型自动指标FVD-UMT和UMTScore,显著改善了与人类评价的相关性,推动了自动评估技术的革新。与现有指标(如CLIPScore、FVD)相比,本文提出的指标在多场景、多类别下表现出更优的相关性和鲁棒性,为未来自动评估提供了新方向。

新颖性

本研究首次系统性引入多维类别体系,结合空间与时间的细粒度分类,特别是针对视频的时序内容,突破了传统单一内容或挑战类别的局限。提出的多类别自动匹配与人工校正流程,确保了数据的丰富性与准确性。基于UMT模型,开发了两种新指标,显著提升了自动评估与人类主观评价的相关性,优于现有的CLIPScore和FVD,填补了自动指标在开源T2V中的应用空白。这些创新为未来视频生成模型的性能评估提供了全新的思路和工具。

局限性

  • 当前FETV的类别划分主要基于静态内容和有限的时序类别,可能无法完全覆盖所有复杂动态场景,存在一定的偏差。模型在高复杂度和细粒度控制任务中的表现仍有限,尤其是在事件顺序和运动细节的精确控制方面。自动指标虽有提升,但在极端复杂或模糊场景下仍难以完全替代人类评估,存在一定的偏差和不一致性。此外,评估过程依赖大量人工校正,成本较高,未来需进一步优化自动化流程。

未来方向

未来将扩展FETV的类别体系,涵盖更多复杂场景和细粒度属性,增强其适应性。计划引入深度学习驱动的自动标注与校正机制,降低人工成本。结合多模态信息,提升模型在复杂动态内容生成中的控制能力。探索端到端的自动评估框架,结合生成模型的训练过程,实现实时性能监控。最终目标是建立统一、标准化的T2V性能评估体系,推动行业标准化与模型性能持续提升。

AI 总览摘要

随着开源文本到视频(T2V)生成技术的快速发展,模型在视觉质量和内容对齐方面取得了显著进步。然而,现有评估体系多停留在宏观指标,难以全面反映模型在不同内容类别和复杂度场景中的实际表现。为解决这一问题,本文提出了FETV(Fine-grained Evaluation for Text-to-Video),一个多维、多层次的评估基准体系。FETV基于三正交维度:主要内容、属性控制和复杂度,结合空间与时间类别,构建了丰富的文本提示分类体系。通过自动匹配与人工校正,收集了619个多类别提示,确保数据多样性与准确性。基于此,研究对四个代表性开源T2V模型进行了细粒度手动评估,揭示了模型在动作、运动、事件顺序等方面的不足,特别是在动态内容和高频细节的生成上存在明显差距。与此同时,本文还评估了自动指标(如CLIPScore、FVD)与人类评价的相关性,发现现有指标相关性较低,限制其在实际应用中的可靠性。为此,作者基于大规模视觉-语言模型(如UMT)开发了改进指标FVD-UMT和UMTScore,显著提升了自动评估的准确性和鲁棒性。整体而言,FETV提供了一个系统性工具,帮助研究者深入理解模型性能差异,推动生成模型的优化与行业标准的制定。这一工作不仅丰富了T2V评估体系,也为未来多模态生成技术的发展奠定了基础。

深度分析

研究背景

文本到视频(T2V)技术经历了从早期基于模板和简单模型,到近年来基于Transformer和扩散模型的快速演进。代表性工作包括CogVideo、Make-a-Video、ZeroScope等,显著提升了生成内容的视觉质量和多样性。现有方法多依赖大规模数据训练,结合深度学习算法实现内容理解与生成,推动了生成内容的逼真度和控制能力。尽管如此,评估体系仍主要依赖宏观指标如FID、FVD和CLIPScore,难以反映模型在不同内容类别和动态场景中的细粒度性能。尤其是在复杂运动、事件顺序和细节控制方面,现有指标表现不足,限制了模型的优化和应用推广。因此,亟需建立更细粒度、时序感知的评估体系,以推动T2V技术的进一步发展。

核心问题

当前T2V模型在生成多样化、复杂动态内容方面仍存在瓶颈,主要表现为质量不均、内容控制不足和评估指标与人类主观感受偏差。现有评估体系缺乏对不同类别、复杂度和时序内容的细粒度分析,难以全面反映模型性能差异。自动指标如CLIPScore和FVD在多场景下相关性低,影响模型优化和行业应用。如何设计一个多维、细粒度且时序感知的评估体系,成为亟待解决的核心问题。

核心创新

本研究创新性地提出FETV,结合空间与时间类别,构建多维分类体系,细化模型性能分析。引入时序类别,强化对动态内容的评估能力。采用自动匹配与人工校正相结合的方法,丰富多类别提示库。基于UMT模型,开发FVD-UMT和UMTScore两种新指标,显著提升自动评估的相关性,优于传统指标。该体系突破了以往单一指标、静态内容的局限,为T2V模型的全面性能评估提供了新工具。

方法详解

  • �� 构建多维类别体系:定义主要内容、属性控制、复杂度三方面,结合空间与时间类别。
  • �� 自动匹配:利用关键词、WordNet、规则匹配文本提示,自动分类。
  • �� 人工校正:手动审核与修正分类标签,确保准确性。
  • �� 数据采集:从MSR-VTT、WebVid等公开数据集获取提示,补充特殊场景提示,形成619个多类别样本。
  • �� 模型评估:对四个开源T2V模型进行手动评分,包括静态、动态内容和属性控制。
  • �� 自动指标:评估CLIPScore、FVD等,结合UMT模型开发改进指标FVD-UMT和UMTScore。
  • �� 相关性分析:计算指标与人类评分的Kendall τc和Spearman ρ,验证指标有效性。

实验设计

采用MSR-VTT、WebVid等数据集,评估四个开源模型(CogVideo、Text2Video-zero、ModelScopeT2V、ZeroScope),通过人工评分覆盖静态、动态内容和属性控制。指标方面,比较CLIPScore、FVD与新指标的相关性,采用多场景、多类别分析。设置不同复杂度和内容类别,进行详细的性能分析。实验还包括模型在不同类别和复杂度下的表现差异,验证FETV的细粒度评估能力。所有评估均由多名评审进行,确保结果的可靠性。

结果分析

手动评估显示,人物和动物视频质量较低,水和景物较优,动作和运动内容生成困难。模型如Text2Video-zero在静态质量上优异,但动态和时序连贯性不足。自动指标相关性偏低(Kendall τc约0.2-0.3),引入UMT模型后,相关性提升至0.6以上。模型在控制运动方向、事件顺序等属性方面表现欠佳,反映出模型在复杂动态内容生成上的局限。新指标显著优于传统指标,为未来自动评估提供了新思路。

应用场景

该评估体系可广泛应用于开源T2V模型的性能比较、模型优化和场景适应性测试。为模型开发者提供细粒度性能反馈,指导模型在不同内容和属性控制上的改进。行业中,可用于内容生成质量监控、内容控制精度评估,以及自动化内容审核。未来,结合实时评估和自适应调控,将推动生成内容在影视、游戏、虚拟现实等领域的应用落地。

局限与展望

现有类别体系主要覆盖静态内容和部分动态类别,难以全面描述极端复杂或模糊场景。自动匹配依赖关键词和规则,可能存在偏差。模型在高复杂度场景中的表现仍有限,尤其在事件顺序和细节控制方面。指标与人类评价仍存在差异,需进一步优化算法和数据标注流程。未来需扩展类别体系,提升自动化水平,增强模型在复杂动态环境中的适应能力。

通俗解读 非专业人士也能看懂

想象你在一家厨房做饭。每次做菜都需要不同的食材、调料和烹饪方法。有时候你会用不同的火候、调料的量,甚至改变菜的摆放顺序。现在,假设你想让一个机器人帮你做菜,你需要告诉它具体的内容,比如“炒青菜”、“加点盐”、“快炒”。但不同的菜、调料和火候都可以组合出不同的味道和效果。这个研究就像是在教机器人如何理解这些不同的组合,确保它做出来的菜既好看又好吃。为了让机器人更聪明,研究人员设计了一套“菜谱分类系统”,把所有可能的菜、调料、火候都分类整理。这样,机器人就能根据不同的“菜谱”做出不同的菜肴,还能检测出做得好不好。这个系统帮助机器人更好地理解复杂的做菜场景,也让我们以后用机器人做饭更方便、更智能。

简单解释 像给14岁少年讲一样

想象你在玩一个超级酷的游戏,你可以告诉游戏里的角色做任何事情,比如“跳舞”、“跑步”、“开车”。但有时候,你希望角色做得更特别,比如“慢动作跳舞”或者“快速跑步”。现在,科学家们也在研究让电脑能根据文字描述生成视频,就像你告诉它“一个人在公园里跳舞”,它就能帮你做出对应的视频。但问题是,这些视频的质量和内容控制还不够好。有的会跳得不自然,有的运动方向也不对。为了让电脑更聪明,研究人员设计了一个特别的“评分系统”,可以帮忙判断视频是不是符合描述,或者质量是不是高。这个系统就像是你老师的评分标准,但它还不够聪明,经常和你老师的评分不一样。于是,科学家们用更聪明的“老师”——大规模的视觉-语言模型,训练出了更好的评分系统,让电脑生成的视频更像人类想要的样子。这项工作让未来的动画、游戏和虚拟现实变得更酷、更真实,也让我们离“让电脑自己讲故事”更近一步。

术语表

FETV (Fine-grained Evaluation for Text-to-Video)

一种多维、多类别的评估基准体系,用于细粒度衡量开源T2V模型性能,结合空间与时间类别,强化对动态内容的评估。

本文提出的评估体系,旨在解决现有指标偏差和内容控制不足的问题。

CLIPScore (CLIP评分)

基于预训练的CLIP模型,衡量生成视频与文本描述的语义相似度,广泛用于内容对齐评估。

用于自动评估生成视频与文本描述的匹配程度,但相关性较低。

FVD (Frechet Video Distance)

衡量真实视频与生成视频分布差异的指标,基于深度神经网络提取特征,反映视频质量。

用于评估视频生成的逼真度,本文提出改进版本FVD-UMT。

UMT (Unified Multimodal Transformer)

一种大规模视觉-语言模型,融合多模态信息,提升内容理解和跨模态匹配能力。

用于开发更相关的自动评估指标,增强模型对动态内容的控制。

开放问题 这项研究留下的未解疑问

  • 1 当前FETV类别体系尚未覆盖所有复杂动态场景,未来需引入更多细粒度和多模态类别,以全面反映模型性能。

应用场景

近期应用

模型性能评估工具

为研究者提供细粒度性能分析工具,帮助优化不同类别和复杂度场景下的模型表现,提升生成内容的质量与控制能力。

内容生成质量监控

行业中可用于自动检测和评估生成视频的质量,确保内容符合预期,提高内容审核效率。

远期愿景

行业标准制定

推动建立统一的T2V性能评估标准,促进技术交流与合作,推动生成模型的商业化应用。

原文摘要

Recently, open-domain text-to-video (T2V) generation models have made remarkable progress. However, the promising results are mainly shown by the qualitative cases of generated videos, while the quantitative evaluation of T2V models still faces two critical problems. Firstly, existing studies lack fine-grained evaluation of T2V models on different categories of text prompts. Although some benchmarks have categorized the prompts, their categorization either only focuses on a single aspect or fails to consider the temporal information in video generation. Secondly, it is unclear whether the automatic evaluation metrics are consistent with human standards. To address these problems, we propose FETV, a benchmark for Fine-grained Evaluation of Text-to-Video generation. FETV is multi-aspect, categorizing the prompts based on three orthogonal aspects: the major content, the attributes to control and the prompt complexity. FETV is also temporal-aware, which introduces several temporal categories tailored for video generation. Based on FETV, we conduct comprehensive manual evaluations of four representative T2V models, revealing their pros and cons on different categories of prompts from different aspects. We also extend FETV as a testbed to evaluate the reliability of automatic T2V metrics. The multi-aspect categorization of FETV enables fine-grained analysis of the metrics' reliability in different scenarios. We find that existing automatic metrics (e.g., CLIPScore and FVD) correlate poorly with human evaluation. To address this problem, we explore several solutions to improve CLIPScore and FVD, and develop two automatic metrics that exhibit significant higher correlation with humans than existing metrics. Benchmark page: https://github.com/llyx97/FETV.

cs.CV