Optimizing Prompts for Text-to-Image Generation

TL;DR

提出基于强化学习的自动提示优化框架PROMPTIST,提升文本到图像生成的效果。

cs.CL 🔴 高级 2022-12-20 46 次浏览
Yaru Hao Zewen Chi Li Dong Furu Wei
生成模型 提示工程 强化学习 文本到图像 深度学习

核心发现

方法论

该方法结合有监督微调和强化学习,利用预训练语言模型(如GPT)对手工设计提示进行微调,随后通过PPO算法探索更优提示。奖励函数结合图像美学评分和CLIP相关性,确保生成图像既符合用户意图又具审美价值。具体流程包括:• 使用手工提示构建平行数据集进行微调;• 采用多样性束搜索保证提示多样性;• 通过采样生成图像,计算相关性和美学得分;• 利用奖励函数引导策略优化。实验在Stable Diffusion上验证,表现优于手工提示和纯微调,尤其在域外提示中效果显著。

关键结果

  • 在Stable Diffusion v1.4和v1.5上,优化提示在自动指标和人类偏好中均优于手工提示,平均提升奖励达31%以上。RL阶段特别增强了域外提示的表现,提升幅度达127%。在DiffusionDB和COCO数据集上,相关性得分由0.25提升至0.26,美学评分显著改善,达6.26分(满分7分)。人类评测显示,用户更偏好由优化提示生成的图像,提升比例超过70%。
  • 通过奖励机制,模型在探索新提示方面表现出强大能力,尤其在未见过的域外数据中,提升幅度达43%至127%。源提示增强策略进一步提升微调模型的泛化能力,改善了多样化输入的适应性。实验还验证了奖励函数设计的有效性,相关性和美学得分的结合实现了图像质量的双重提升。
  • 方法的核心创新在于结合有监督微调与强化学习,利用多目标奖励引导模型自动生成符合用户意图且审美优越的提示。这一框架突破了传统手工工程的局限,实现提示的自动化、通用化,极大提升了文本到图像生成的效率和效果。

研究意义

该研究解决了文本到图像模型中提示设计的低效和模型特异性强的问题,推动了自动提示工程的发展。通过自动化优化,显著降低了用户对专业知识的依赖,增强了模型的适应性和泛化能力,为未来多模态生成系统的普及奠定基础。此方法不仅提升了生成质量,也为模型调控提供了新思路,有望在艺术创作、虚拟现实等领域产生深远影响。

技术贡献

提出结合有监督微调与强化学习的提示优化框架,利用CLIP相关性和美学评分作为奖励,设计了多目标优化策略。采用多样性束搜索确保提示多样性,利用PPO算法实现策略探索。创新点在于:• 构建平行提示数据集实现微调;• 设计结合相关性和美学的奖励函数;• 引入源提示增强策略提升泛化能力。这些技术突破极大推动了自动提示工程的研究进展。

新颖性

本研究首次系统性结合微调与强化学习,自动优化文本提示以提升文本到图像生成质量。区别于传统手工工程和连续提示优化,本方法在黑箱模型中实现端到端自动化,利用多目标奖励引导模型探索高质量提示,显著优于现有的提示搜索和 paraphrasing 方法。

局限性

  • 模型依赖于预训练语言模型和CLIP,可能在特定领域或风格中表现不足,存在泛化局限。
  • 奖励函数设计主要基于相关性和美学评分,可能未能完全捕捉用户主观偏好,存在偏差。
  • 训练过程计算成本较高,尤其在大规模数据和多轮强化学习中,限制了实时应用的可能性。

未来方向

未来将探索引入用户反馈进行动态调整,提升个性化和多样性。同时,结合多模态信息丰富奖励机制,增强模型对复杂场景的适应能力。此外,优化训练效率,降低计算成本,也是后续的重要方向。

AI 总览摘要

随着生成模型的快速发展,提示设计成为影响文本到图像生成质量的关键因素。传统的手工提示工程耗时且难以迁移,限制了模型的普及和应用。为此,本文提出了PROMPTIST,一种基于强化学习的自动提示优化框架,旨在自动将用户输入转化为模型偏好的提示。该方法首先利用有监督微调,基于手工设计的提示数据训练语言模型,然后通过PPO强化学习探索更优提示。奖励函数结合CLIP相关性和美学评分,确保生成的图像既符合用户意图又具审美价值。实验在Stable Diffusion上验证,结果显示优化提示在自动指标和人类偏好中均优于手工提示,尤其在域外数据中表现出强大泛化能力。该技术突破了传统提示工程的瓶颈,为多模态生成系统的自动化和智能化提供了新思路。未来,结合用户反馈和多模态奖励机制,将进一步提升模型的个性化和适应性,推动生成艺术、虚拟现实等行业的创新发展。

深度分析

研究背景

近年来,生成模型,尤其是文本到图像(text-to-image)技术,取得了显著进展。早期采用GANs(如StackGAN)逐步演进到基于自回归和扩散模型(如DALL·E、Stable Diffusion),极大提升了生成质量。提示工程作为关键环节,传统依赖人工设计,耗时且难以迁移,限制了模型的普及。近年来,自动提示搜索、 paraphrasing 和连续提示优化等方法出现,但仍面临泛化和效率问题。本研究旨在突破这些瓶颈,结合强化学习实现提示的自动化优化。

核心问题

当前文本到图像模型对提示的敏感性较高,手工工程难以满足多样化需求,且缺乏通用性。手工提示难以适应不同模型版本和新领域,导致生成效果不稳定。如何自动化生成高质量、符合用户意图的提示,成为亟需解决的问题。此外,模型在域外数据上的表现不足,限制了其应用范围。

核心创新

本研究的核心创新在于:• 结合有监督微调和强化学习,自动优化提示;• 设计多目标奖励函数,结合CLIP相关性和美学评分,平衡相关性与审美;• 引入源提示增强策略,提升模型泛化能力。这些创新突破了传统手工工程的局限,实现了提示的端到端自动化,显著提升了生成质量和效率。

方法详解

  • �� 收集手工设计的提示对,构建平行数据集,进行微调;• 利用多样性束搜索生成多样提示,保证探索空间;• 采样生成图像,计算CLIP相关性和美学评分,作为奖励;• 设计奖励函数,结合相关性、美学和KL正则,平衡目标;• 采用PPO算法,优化策略参数,持续探索更优提示。整个流程实现了从用户输入到模型偏好的自动转化。

实验设计

在Stable Diffusion v1.4和v1.5上进行验证,使用DiffusionDB、COCO和ImageNet-21k数据集。微调阶段采用90k手工提示,强化学习阶段探索域外数据。评估指标包括自动奖励(相关性和美学得分)和人类偏好。超参数设置包括:批次256,学习率5e-5,束搜索宽度8,最大生成长度15-75。对比手工提示、微调和强化学习模型,验证其在多场景下的优越性。

结果分析

优化提示在奖励和偏好指标上均优于手工提示,平均提升超过30%。在域外数据中,强化学习模型表现尤为突出,奖励提升达127%。相关性得分由0.25提升至0.26,美学评分显著改善。人类评测显示,用户更喜欢由优化提示生成的图像,优先偏好比例超过70%。这些结果验证了方法的有效性和泛化能力。

应用场景

该技术可广泛应用于虚拟艺术创作、广告设计、虚拟现实等领域,降低专业门槛,提升生成效率。用户只需提供简洁描述,系统自动生成高质量提示,极大简化操作流程。未来还可结合个性化偏好,打造智能化、多样化的生成平台,推动多模态内容产业的发展。

局限与展望

模型依赖预训练语言模型和CLIP,可能在特定风格或专业领域表现不足。奖励函数主要基于相关性和美学评分,未充分考虑用户主观偏好。训练成本较高,难以实现实时应用。未来需优化算法效率,丰富奖励机制,提升个性化和多样性。

通俗解读 非专业人士也能看懂

想象你在厨房里做菜,提示就像是你告诉厨师你想吃什么。传统上,你需要用很多时间描述每个细节,比如“放点盐、加点胡椒”,厨师根据你的描述做菜,但每次都要亲自调试。现在,有个智能厨师,它能听懂你的基本想法,然后自己试着调整调料和做法,让菜变得更好吃。这个系统先学习了很多菜谱(微调),然后通过不断试验(强化学习),找到最符合你口味的做法。它还会用一些评分(比如味道好不好)来指导自己,确保做出来的菜既符合你的意图,又好看好吃。这样,你只需要告诉它大概想吃什么,它就能帮你自动调出最棒的菜肴。这就像一个聪明的厨房助手,帮你省时省力,还能不断变得更厉害。

简单解释 像给14岁少年讲一样

想象你喜欢画画,但不太会用画笔。你告诉一个智能机器人“我想画一只蓝色的狼”,它会试着自己画出不同版本。有时候画得不太像你想的,但它会学习你的喜好,慢慢改进。它会用一种叫“强化学习”的方法,就像你给它评分:画得漂亮就给高分,不满意就给低分。这样,它不断尝试,最后画出的狼既符合你的描述,又很漂亮。这个机器人还会记住你喜欢的风格,比如“像漫画一样”或者“很写实”,帮你画出更满意的作品。它就像一个聪明的画家助手,能帮你快速得到理想的画作,不用自己费心琢磨。这个方法让机器变得更聪明,也让我们的创作变得更轻松有趣。

原文摘要

Well-designed prompts can guide text-to-image models to generate amazing images. However, the performant prompts are often model-specific and misaligned with user input. Instead of laborious human engineering, we propose prompt adaptation, a general framework that automatically adapts original user input to model-preferred prompts. Specifically, we first perform supervised fine-tuning with a pretrained language model on a small collection of manually engineered prompts. Then we use reinforcement learning to explore better prompts. We define a reward function that encourages the policy to generate more aesthetically pleasing images while preserving the original user intentions. Experimental results on Stable Diffusion show that our method outperforms manual prompt engineering in terms of both automatic metrics and human preference ratings. Moreover, reinforcement learning further boosts performance, especially on out-of-domain prompts. The pretrained checkpoints are available at https://aka.ms/promptist. The demo can be found at https://aka.ms/promptist-demo.

cs.CL cs.CV