Guiding What Not to Generate: Automated Negative Prompting for Text-Image Alignment

TL;DR

提出NPC方法,通过负提示优化文本-图像对齐,在GenEval++上表现提升54%。

cs.CV 🔴 高级 2025-12-09 38 次浏览
Sangha Park Eunji Kim Yeongtak Oh Jooyoung Choi Sungroh Yoon
文本生成 图像生成 负提示 扩散模型 对齐优化

核心发现

方法论

本文提出了一种自动化负提示生成方法(NPC),通过Verifier-Captioner-Proposer框架生成候选负提示,并利用显著性评分选择最佳提示,无需额外图像生成。

关键结果

  • 在GenEval++基准测试中,NPC取得0.571分,相比最强基线Bagel的0.371分提升了54%。
  • 在Imagine-Bench基准测试中,NPC在所有任务中表现最佳,展示了对复杂和超现实指令的强大对齐能力。
  • 消融实验表明,负提示显著提高了模型对关键文本标记的注意力分配。

研究意义

NPC解决了文本-图像生成中复杂组合结构和超现实元素对齐的长期难题,为扩散模型提供了一种全自动的负提示优化路径,对学术研究和工业应用均有重要意义。

技术贡献

本文扩展了负提示的使用范围,提出了一种基于注意力机制的显著性评分方法,并设计了一个自动化管道以减少人工干预,同时显著提升了文本-图像生成的对齐性能。

新颖性

NPC首次系统性地分析了目标负提示和非目标负提示对对齐的影响,并结合两者提出了一种全新的自动化负提示生成和选择方法。

局限性

  • NPC对提示生成的质量依赖于Verifier和Captioner的性能,可能受限于模型的语言理解能力。
  • 在极端复杂或模糊的指令下,负提示的效果可能不稳定。
  • 需要进一步优化计算效率以适应实时应用场景。

未来方向

未来可以探索如何结合更多上下文信息生成更精准的负提示,同时优化计算效率以支持大规模实时生成场景。

AI 总览摘要

文本-图像生成技术近年来取得了显著进步,但在处理复杂组合结构或超现实指令时,模型仍然难以实现精确的对齐。现有方法主要依赖正向指导,通过强化目标内容的生成来改善对齐。然而,这些方法往往忽略了负向指导的重要性,即明确告诉模型不应生成哪些内容。

本文提出了一种自动化负提示生成方法(NPC),通过Verifier-Captioner-Proposer框架生成候选负提示,并利用显著性评分选择最佳提示。NPC无需额外图像生成,显著减少了生成尝试次数,同时提升了对齐性能。在GenEval++基准测试中,NPC取得了0.571分,相比最强基线Bagel的0.371分提升了54%。在Imagine-Bench基准测试中,NPC在所有任务中表现最佳,展示了对复杂和超现实指令的强大对齐能力。

通过分析注意力机制,研究发现负提示能够显著提高模型对关键文本标记的注意力分配,从而改善对齐质量。尽管NPC在性能上表现优异,但其对提示生成质量的依赖以及计算效率问题仍需进一步优化。未来研究可以探索结合更多上下文信息生成更精准的负提示,同时优化计算效率以支持大规模实时生成场景。

深度分析

研究背景

近年来,扩散模型在文本-图像生成领域取得了突破性进展,代表性模型包括Stable Diffusion、DALL-E 3等。然而,这些模型在处理复杂组合结构和超现实指令时仍面临显著挑战,尤其是在多对象关系、属性绑定和数量控制方面。

核心问题

文本-图像生成的核心问题在于如何实现精确的文本-图像对齐。现有模型在处理复杂组合指令时容易出现生成错误,例如对象数量不匹配或属性绑定错误,这对实际应用构成了重大障碍。

核心创新

NPC方法的核心创新包括:1) 提出Verifier-Captioner-Proposer框架自动生成负提示;2) 设计显著性评分方法以选择最佳负提示;3) 系统性分析目标负提示和非目标负提示对对齐的影响。

方法详解

  • �� Verifier检查生成图像是否满足指令,并返回失败原因作为目标负提示。
  • �� Captioner生成图像的详细描述,用于提供非目标负提示。
  • �� Proposer结合Verifier和Captioner的输出生成负提示候选。
  • �� 显著性评分方法评估负提示对对齐的潜在贡献,并选择最佳提示。

实验设计

实验在GenEval++和Imagine-Bench基准测试上进行,分别评估组合控制能力和超现实指令对齐能力。使用FLUX.1-dev作为生成器,Verifier和Captioner基于GPT-4实现。

结果分析

在GenEval++基准测试中,NPC取得0.571分,相比最强基线Bagel的0.371分提升了54%。在Imagine-Bench基准测试中,NPC在所有任务中表现最佳,展示了对复杂和超现实指令的强大对齐能力。

应用场景

NPC可用于生成高精度的广告素材、艺术创作以及复杂场景的自动化设计,尤其适合需要精确对齐的场景。

局限与展望

NPC对提示生成质量的依赖可能导致在极端复杂指令下效果不稳定,同时计算效率问题需要进一步优化以支持实时应用。

通俗解读 非专业人士也能看懂

可以将NPC方法类比为一个智能厨师助手。假设你给助手一个复杂的菜谱,它不仅需要知道如何做菜,还需要避免犯错。例如,你要求一个甜点,但助手误加了辣椒。NPC的作用类似于一个纠错系统,它会分析菜谱和成品,指出哪里出了问题,并生成一个“不要加辣椒”的负提示,从而帮助助手更好地完成任务。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,要求AI画出“一个绿色消防栓和一个黑色大象”。结果AI画错了,把消防栓画成了黄色。NPC就像一个游戏里的纠错工具,它会告诉AI:“别画黄色消防栓!”同时,它还会注意到背景里有不相关的东西,比如一个复古电视,并告诉AI:“别画复古电视!”这样,AI就能专注于画正确的东西啦!

术语表

Negative Prompt (负提示)

用于抑制生成中不需要内容的提示,帮助模型专注于目标内容。

在NPC中用于优化文本-图像对齐。

Verifier (验证器)

检查生成图像是否满足指令,并返回失败原因。

用于生成目标负提示。

Captioner (描述器)

生成图像的详细描述,提供非目标负提示。

在NPC框架中用于补充负提示候选。

Salient Score (显著性评分)

评估负提示对文本对齐的潜在贡献的评分方法。

用于选择最佳负提示。

GenEval++

测试模型组合控制能力的基准数据集。

用于评估NPC的性能。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化负提示生成质量以适应复杂指令?
  • 2 是否可以结合更多上下文信息提升对齐效果?

应用场景

近期应用

广告生成

帮助生成精确对齐的广告素材,减少人工干预。

艺术创作

支持复杂场景的自动化设计,提升创作效率。

远期愿景

实时生成系统

优化计算效率以支持实时文本-图像生成场景。

原文摘要

Despite substantial progress in text-to-image generation, achieving precise text-image alignment remains challenging, particularly for prompts with rich compositional structure or imaginative elements. To address this, we introduce Negative Prompting for Image Correction (NPC), an automated pipeline that improves alignment by identifying and applying negative prompts that suppress unintended content. We begin by analyzing cross-attention patterns to explain why both targeted negatives-those directly tied to the prompt's alignment error-and untargeted negatives-tokens unrelated to the prompt but present in the generated image-can enhance alignment. To discover useful negatives, NPC generates candidate prompts using a verifier-captioner-proposer framework and ranks them with a salient text-space score, enabling effective selection without requiring additional image synthesis. On GenEval++ and Imagine-Bench, NPC outperforms strong baselines, achieving 0.571 vs. 0.371 on GenEval++ and the best overall performance on Imagine-Bench. By guiding what not to generate, NPC provides a principled, fully automated route to stronger text-image alignment in diffusion models. Code is released at https://github.com/wiarae/NPC.

cs.CV cs.AI