CRAFT: Continuous Reasoning and Agentic Feedback Tuning for Multimodal Text-to-Image Generation

TL;DR

CRAFT框架通过连续推理和反馈调优显著提升多模态文本到图像生成的准确性和可控性。

cs.CV 🔴 高级 2025-12-23 37 次浏览
V. Kovalev A. Kuvshinov A. Buzovkin D. Pokidov D. Timonin
多模态生成 推理优化 视觉语言模型 文本到图像 模型调优

核心发现

方法论

CRAFT框架将用户提示分解为显式的视觉约束问题,利用视觉语言模型验证生成图像,并通过LLM进行针对性提示更新,迭代优化直至满足所有约束。

关键结果

  • 在DSG-1K数据集上,VQA准确率提升至0.91,显著优于基线模型的0.78。
  • 在Parti-Prompt数据集上,CRAFT的DSG评分达到0.90,超越基线模型的0.743。
  • 通过两次迭代,轻量级生成器的偏好评估胜率提高超过50%。

研究意义

该研究解决了多模态生成模型在复杂提示下的可靠性问题,显著提升了生成质量,同时保持推理时间开销极低,为小型模型提供了接近高端系统的性能。

技术贡献

提出了一种训练无关且模型无关的推理优化框架,首次将显式约束驱动的推理引入多模态生成领域,提供了可解释性和可控性的新标准。

新颖性

CRAFT首次将视觉问题分解与约束验证结合,避免了传统方法中隐式提示重写的不可控性,显著提升了生成质量。

局限性

  • 对复杂场景的文本渲染仍有一定局限,尤其是长文本提示。
  • 需要依赖强大的视觉语言模型进行约束验证。

未来方向

未来研究可以探索更高效的约束验证机制,以及将CRAFT扩展到其他生成任务如视频生成。

AI 总览摘要

多模态文本到图像生成模型在处理复杂提示时常面临准确性和可控性问题。CRAFT框架通过显式推理和反馈调优解决了这一难题,将用户提示分解为结构化的视觉约束问题,并利用视觉语言模型验证生成结果。实验表明,CRAFT在多个数据集上显著提升了生成质量,尤其是轻量级生成器的性能接近高端系统,同时推理开销极低。该研究为多模态生成领域提供了一种新的优化范式,具有广泛的应用潜力。

CRAFT的核心技术包括显式视觉问题生成、约束验证和针对性提示更新。这种迭代优化过程确保了生成结果的可解释性和可靠性,同时避免了传统方法中提示重写的不可控性。通过两次迭代,CRAFT在DSG-1K数据集上的VQA准确率提升至0.91,显著优于基线模型。

尽管取得了显著进展,CRAFT在复杂场景的文本渲染方面仍有一定局限。未来研究可以进一步优化约束验证机制,并探索其在其他生成任务中的应用,如视频生成和跨模态内容创作。

深度分析

研究背景

多模态生成领域近年来取得了显著进展,扩散模型和变换器模型在视觉质量上表现优异。然而,这些模型在处理复杂提示时常面临约束不一致、文本渲染错误等问题。现有方法多依赖隐式提示重写,缺乏可解释性和可靠性。

核心问题

多模态生成模型在复杂提示下的可靠性和可控性问题亟待解决。生成结果需要同时满足多种约束,如对象属性、空间关系、文本渲染等,这对现有模型提出了巨大挑战。

核心创新

CRAFT框架的核心创新包括显式视觉问题生成、约束验证和针对性提示更新。与传统方法相比,CRAFT避免了隐式提示重写的不可控性,通过显式推理提升了生成质量。

方法详解

  • �� 提示分解:将用户提示转化为显式视觉问题集。
  • �� 约束验证:利用视觉语言模型验证生成结果是否满足约束。
  • �� 提示更新:通过LLM针对性地优化提示。
  • �� 停止条件:当所有约束满足或达到最大迭代次数时停止。

实验设计

实验使用DSG-1K和Parti-Prompt数据集,评估了CRAFT在多个模型上的性能,包括FLUX-Schnell、Qwen-Image等。采用VQA和DSG评分作为主要指标,同时进行偏好评估。

结果分析

CRAFT在DSG-1K数据集上的VQA准确率提升至0.91,DSG评分达到0.857;在Parti-Prompt数据集上,DSG评分提升至0.90,偏好评估胜率提高超过50%。

应用场景

CRAFT可用于增强多模态生成模型的可靠性,尤其适用于复杂提示场景,如广告设计、教育内容创作等。

局限与展望

对复杂场景的文本渲染仍有局限,推理过程依赖强大的视觉语言模型,可能增加计算成本。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,想要同时完成几个任务:煮饭、炒菜、切水果。传统方法像是一次性完成所有任务,结果可能会有遗漏或错误。而CRAFT像一个聪明的助手,先检查每个任务是否完成,再根据问题调整步骤,确保每道菜都完美呈现。

简单解释 像给14岁少年讲一样

想象你在玩游戏,需要完成一个复杂任务,比如建造一个城堡。普通方法可能会一次性建造,结果有些部分不符合要求。而CRAFT就像一个聪明的NPC助手,帮你检查每个部分是否符合要求,并告诉你哪里需要改进,最终让你的城堡完美无缺!

术语表

视觉语言模型 (Vision-Language Model)

结合视觉和语言理解的模型,用于图像和文本的跨模态任务。

用于验证生成图像是否满足提示约束。

约束验证 (Constraint Verification)

检查生成结果是否满足提示中的显式要求。

通过视觉语言模型完成。

提示更新 (Prompt Refinement)

根据约束验证结果优化用户提示。

由LLM实现针对性优化。

DSG评分 (Davidsonian Scene Graph)

基于场景图的图像一致性评估指标。

用于评估生成结果的约束满足情况。

偏好评估 (Preference Evaluation)

通过对比生成结果,评估用户偏好。

用于衡量CRAFT的实际效果。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升复杂场景的文本渲染质量?
  • 2 是否可以减少对视觉语言模型的依赖?

应用场景

近期应用

广告设计

帮助生成符合品牌要求的视觉内容,提升创意效率。

教育内容创作

生成复杂场景的教学图像,辅助教学。

远期愿景

跨模态创作

实现从文本到视频的自动生成,推动内容创作领域的革新。

原文摘要

Recent work has shown that inference-time reasoning and reflection can improve text-to-image generation without retraining. However, existing approaches often rely on implicit, holistic critiques or unconstrained prompt rewrites, making their behavior difficult to interpret, control, or stop reliably. In contrast, large language models have benefited from explicit, structured forms of **thinking** based on verification, targeted correction, and early stopping. We introduce CRAFT (Continuous Reasoning and Agentic Feedback Tuning), a training-free and model-agnostic framework for multimodal image generation. CRAFT transforms a user prompt into a set of explicit, dependency-structured visual constraints, verifies generated images using a vision-language model, and performs targeted prompt updates only when specific constraints are violated. This iterative process includes an explicit stopping criterion, resulting in an interpretable and controllable inference-time refinement loop. Across multiple model families and challenging benchmarks, CRAFT consistently improves compositional accuracy, text rendering, and preference-based evaluations, with particularly strong gains for lightweight generators. Importantly, these improvements incur only a negligible inference-time overhead, allowing smaller or cheaper models to approach the quality of substantially more expensive systems. Our results suggest that explicitly structured, constraint-driven inference-time reasoning is a key ingredient for improving the reliability of multimodal generative models.

cs.CV