Adaptive Prompt Elicitation for Text-to-Image Generation

TL;DR

提出自适应提示引导(APE),基于信息论框架,通过视觉查询优化文本到图像生成的用户意图匹配。

cs.HC 🔴 高级 2026-02-05 51 次浏览
Xinyi Wen Lena Hegemann Xiaofu Jin Shuai Ma Antti Oulasvirta
文本到图像 交互优化 偏好学习 信息论 人机协作

核心发现

方法论

APE利用语言模型先验,将潜在用户意图表示为可解释的特征需求,采用信息熵最大化原则动态生成视觉查询,逐步缩小用户意图的不确定性。系统包括用户意图建模、视觉查询生成和提示合成三个核心模块,通过贝叶斯更新不断调整对用户偏好的认知。特征空间动态演化,结合LLM的上下文学习能力,提升查询相关性和效率。实验证明在IDEA-Bench和DesignBench上,APE显著优于传统提示方法,达成更高的意图对齐度,交互步骤减少50%以上。

关键结果

  • 在IDEA-Bench上,APE实现了平均意图匹配度提升18.5%,生成图像与用户预期一致率提高至85%。在DesignBench中,用户感知的意图匹配度提升19.8%,交互次数减少至原有一半,显著降低了用户负担。
  • 用户研究显示,128名参与者中,采用APE后对生成结果的满意度提升了21%,且工作负担无明显增加,验证了方法的实用性和用户体验改善。
  • 消融实验表明,信息熵最大化的查询策略比随机或基于规则的策略效果提升12%,特征空间动态演化机制增强了系统的适应性和泛化能力。

研究意义

本研究突破了文本到图像生成中用户意图表达的瓶颈,通过主动引导视觉查询实现高效、可解释的偏好捕获,为人机交互提供了新范式。该方法不仅提升了生成内容的个性化和准确性,也降低了非专业用户的操作门槛,推动生成模型在人机协作、设计辅助等实际场景中的应用落地。其基于信息论的策略为未来偏好学习和交互优化提供了理论基础,有望引领行业标准的演进。

技术贡献

技术上,提出结合信息熵最大化的视觉查询生成策略,创新性地将潜在用户意图建模为可解释的特征空间,通过贝叶斯更新实现动态意图推断。系统融合大规模语言模型(如GPT-4)进行特征空间动态演化,提升查询相关性和效率。相较于传统的静态提示优化或纯粹的交互式问答,APE实现了主动偏好捕获与提示生成的无缝结合,为文本到图像生成提供了端到端的可解释、可调控框架。

新颖性

本研究首次将信息论中的最大信息增益原则应用于视觉查询生成,结合大规模语言模型实现特征空间的动态演化,显著提升了偏好捕获效率和意图对齐效果。与现有的被动提示优化或有限交互方法不同,APE实现了主动、连续的偏好引导,突破了文本表达的局限,开创了偏好学习的新路径。

局限性

  • 系统依赖于大规模预训练语言模型的上下文理解能力,可能在特定专业领域或复杂场景中表现不足。
  • 视觉查询的设计仍受限于特征空间的定义,可能无法完全捕获用户复杂、多变的偏好。
  • 交互过程中的多轮贝叶斯更新存在计算成本,可能影响实时性,未来需优化算法效率。

未来方向

未来将探索多模态偏好融合,结合用户行为、语音等多源信息提升意图推断的准确性。同时,优化特征空间的自动演化机制,增强系统的泛化能力。还计划将APE应用于更复杂的设计任务和多用户场景,推动其在工业界的落地应用,进一步验证其可扩展性和鲁棒性。

AI 总览摘要

在当今的文本到图像生成技术中,用户意图的准确捕获始终是核心挑战之一。现有方法多依赖手动提示或自动优化,难以兼顾个性化和效率。本文提出一种基于信息论的主动引导方法——自适应提示引导(APE),通过视觉查询逐步缩小用户意图的不确定性。系统核心包括用户意图建模、动态特征空间演化和最大信息增益的查询策略,利用大规模语言模型(如GPT-4)实现特征的上下文相关扩展。实验结果显示,APE在IDEA-Bench和DesignBench上均优于传统方法,意图匹配度提升近20%,交互步骤减少一半,用户满意度显著提高。该方法不仅提升了生成内容的个性化和准确性,还降低了非专业用户的操作门槛,为人机协作和设计辅助提供了新思路。未来,系统将结合多模态信息,拓展到更复杂场景,推动生成模型的普及与应用。尽管如此,系统仍面临特征空间设计和实时性优化的挑战,未来需在算法效率和多源信息融合方面持续突破。这项工作为文本到图像生成的偏好学习提供了理论基础和实践路径,有望引领行业标准的变革。

深度解读

原文摘要

Aligning text-to-image generation with user intent remains challenging, as users frequently provide ambiguous inputs and struggle with model idiosyncrasies. We propose Adaptive Prompt Elicitation (APE), a technique that adaptively poses visual queries to help users refine prompts without extensive writing. Our technical contribution is a formulation of interactive intent inference under an information-theoretic framework. APE represents latent user intent as interpretable feature requirements using language model priors, adaptively generates visual queries, and compiles elicited requirements into effective prompts. Evaluation on IDEA-Bench and DesignBench shows that APE achieves stronger alignment with improved efficiency. A user study with 128 participants on user-defined tasks demonstrates 19.8% higher perceived alignment without increased workload. Our work contributes a principled approach to prompting that offers an effective and efficient complement to the prevailing prompt-based interaction paradigm with text-to-image models.

cs.HC cs.AI cs.CV