DynEval: Holistic Evaluations of T2I Generative Models in the Wild

TL;DR

DynEval通过动态评估框架提升T2I模型的文本图像对齐和图像质量,使用GenDB和DynEvalInstruct数据集。

cs.CV 🔴 高级 2026-07-13 30 次浏览
Shyam Marjit Dheeraj Baiju Anuj Shikarkhane Akhil Sakthieswaran Sayak Paul Anirban Chakraborty
文本生成 图像生成 动态评估 机器学习 数据集

核心发现

方法论

DynEval是一种动态评估框架,旨在同时评估文本到图像的对齐和图像质量。构建了两个大型数据集:GenDB包含50万个人工撰写的提示-图像对,DynEvalInstruct包含25万条指令数据集。通过课程学习策略,使用更大的教师视觉语言模型的优越评估能力进行蒸馏,形成DynEval-2B和DynEval-4B。

关键结果

  • 在11个基准测试中,DynEval与人类判断的整体相关性更高,尤其是在36个T2I模型的42个子类别和9个语义维度中提供了细粒度分析。
  • 与现有评估器相比,DynEval在多个基准测试中表现出更高的准确性和一致性。
  • 通过精细调优的小型评估器实现了更高效的评估能力。

研究意义

该研究显著提升了T2I模型的评估能力,解决了现有评估器在捕捉细微失误模式上的不足,为大规模自动化评估提供了新的可能性。通过引入动态评估框架,DynEval能够更好地模拟人类判断,推动了文本到图像生成领域的进步。

技术贡献

DynEval通过动态评估框架和大规模数据集的结合,提供了一个独特的评估方法。其创新之处在于结合文本-图像对齐和图像质量评估,提供了更全面的评估能力,并通过课程学习策略实现了高效的模型蒸馏。

新颖性

DynEval首次引入了动态评估框架,结合大规模数据集和课程学习策略,实现了对T2I模型的全面评估。与现有方法相比,其在评估细粒度失误模式方面具有显著优势。

局限性

  • 在特定场景下,DynEval可能无法完全捕捉所有细微的图像失误。
  • 需要大量计算资源进行大规模数据集的处理和模型训练。
  • 对新出现的生成模型的适应性有待进一步验证。

未来方向

未来研究可以探索如何进一步优化DynEval的计算效率,并扩展其对新兴生成模型的适应性。此外,可以考虑将其应用于其他多模态生成任务。

AI 总览摘要

近年来,文本到图像(T2I)生成技术取得了显著进展,能够生成高度逼真的图像。然而,如何可靠地评估这些输出仍然是一个挑战。现有的自动评估器往往依赖于静态提示集,难以捕捉细微的失误模式,如部分提示不对齐、组合错误或视觉上合理但语义上不正确的生成。

为了解决这些问题,本文介绍了DynEval,一种动态评估框架,旨在同时评估T2I模型的文本图像对齐和图像质量。为了支持超越有限人工标注数据的可扩展训练,我们构建了两个大型数据集。首先,我们建立了GenDB,一个由人工撰写的提示生成的50万对提示-图像对的集合。其次,在GenDB的基础上,我们构建了DynEvalInstruct,一个包含25万条指令数据集,通过结构化评估管道提炼而成。

使用这些数据集,我们通过课程学习策略对小型评估器进行全面微调,有效地提炼出更大教师视觉语言模型的优越评估能力,形成了DynEval-2B和DynEval-4B。在11个基准测试中,与现有评估器相比,我们的评估器与人类判断的整体相关性更高。此外,它提供了36个T2I模型在42个子类别和9个语义维度上的能力和失误模式的细粒度分析。

深度分析

研究背景

文本到图像生成技术近年来取得了快速发展,从多阶段U-Net扩展到高效的扩散变压器模型。这些模型能够在中等硬件上生成高分辨率图像。然而,可靠评估这些生成图像的质量仍然是一个挑战,特别是在大规模上。现有评估方法往往依赖于静态提示集,难以捕捉细微的失误模式。

核心问题

现有的T2I评估方法在捕捉生成图像的细微失误模式方面存在不足,如部分提示不对齐、组合错误或视觉上合理但语义上不正确的生成。这些方法通常依赖于静态提示集,难以适应开放集提示。

核心创新

DynEval引入了动态评估框架,结合大规模数据集和课程学习策略,实现了对T2I模型的全面评估。其创新之处在于结合文本-图像对齐和图像质量评估,提供了更全面的评估能力。

方法详解

  • �� 构建GenDB数据集,包含50万对提示-图像对。• 构建DynEvalInstruct数据集,包含25万条指令数据集。• 使用课程学习策略对小型评估器进行微调。• 结合文本-图像对齐和图像质量评估,提供全面评估。

实验设计

实验设计包括11个基准测试,使用GenDB和DynEvalInstruct数据集进行训练和评估。基准测试涵盖了36个T2I模型在42个子类别和9个语义维度上的表现。

结果分析

实验结果表明,DynEval在11个基准测试中与人类判断的整体相关性更高,尤其是在细粒度分析方面表现出色。与现有评估器相比,DynEval在多个基准测试中表现出更高的准确性和一致性。

应用场景

DynEval可用于T2I模型的自动化评估,适用于需要大规模评估生成图像质量的场景。其动态评估能力使其能够适应多样化的提示和生成模型。

局限与展望

DynEval在特定场景下可能无法完全捕捉所有细微的图像失误。此外,其计算资源需求较高,对新兴生成模型的适应性有待验证。未来研究可以探索如何优化其计算效率,并扩展其适应性。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你有一个食谱(文本提示),需要根据食谱准备食材(图像生成)。现有的评估方法就像只检查你是否用了正确的食材,而不管它们是否切得整齐、煮得恰到好处。DynEval就像一个经验丰富的厨师,不仅检查食材,还会看它们是否切得均匀、煮得适中。通过这种方式,DynEval能够更全面地评估你的烹饪成果(图像质量)。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你需要根据提示(文本)创建一个虚拟世界(图像)。现有的评估方法就像只检查你是否放置了正确的物品,而不管它们是否摆放得当。DynEval就像一个聪明的游戏助手,不仅检查物品,还会看它们是否摆放得合理、符合游戏规则。通过这种方式,DynEval能够更全面地评估你的游戏世界(图像质量)。

术语表

DynEval

一种动态评估框架,用于评估文本到图像生成模型的文本图像对齐和图像质量。

在本文中用于评估T2I模型的生成质量。

GenDB

一个包含50万对提示-图像对的数据集,用于支持DynEval的训练。

作为DynEval评估框架的基础数据集。

DynEvalInstruct

一个包含25万条指令的数据集,用于训练DynEval评估器。

用于支持DynEval评估器的全面微调。

T2I模型

文本到图像生成模型,能够根据文本提示生成相应的图像。

本文中评估的对象。

课程学习策略

一种逐步学习的方法,从简单到复杂,逐步提高模型的评估能力。

用于训练DynEval评估器。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化DynEval的计算效率,以适应更大规模的数据集和模型。
  • 2 如何扩展DynEval对新兴生成模型的适应性,以保持其评估的准确性和一致性。

应用场景

近期应用

T2I模型评估

DynEval可用于自动化评估T2I模型的生成质量,适用于需要大规模评估的场景。

远期愿景

多模态生成任务

DynEval的动态评估框架可扩展应用于其他多模态生成任务,如文本到视频生成。

原文摘要

Recent advances in text-to-image (T2I) generation have led to models capable of producing highly realistic images. Yet, reliably evaluating their outputs remains challenging, especially at scale. Existing automatic evaluators, often relying on a static prompt set, struggle to capture subtle failure modes such as partial prompt misalignment, compositional errors, or visually plausible but semantically incorrect generations. In this work, we introduce DynEval, a Dynamic Evaluation framework designed to jointly assess text-to-image alignment and image quality of T2I models. To support scalable training beyond limited human-annotated data, we construct two large datasets. First, we build GenDB, a collection of 500K prompt-image pairs generated from human-written prompts drawn from DiffusionDB using a tiered prompt-model generation strategy. Second, building upon GenDB, we construct DynEvalInstruct, a 250K instruction dataset comprising prompt-image-response triplets distilled from a structured evaluation pipeline that decomposes evaluation into text-image alignment and visual quality reasoning. Using this dataset, we perform full fine-tuning of a compact evaluator through a curriculum learning strategy to effectively distill the superior evaluation capabilities of a larger teacher vision-language model, resulting in DynEval-2B and DynEval-4B. In extensive comparisons against existing evaluators across 11 benchmarks, our evaluator achieves a higher overall correlation with human judgments. Furthermore, it provides fine-grained analysis of the capabilities and failure modes of 36 T2I models across 42 subcategories and 9 semantic dimensions.

cs.CV