LeX-Art: Rethinking Text Generation via Scalable High-Quality Data Synthesis

TL;DR

LeX-Art通过高质量数据合成和模型微调,提升文本图像生成中的文本渲染精度,PNED提升79.81%。

cs.CV 🔴 高级 2025-03-28 45 次浏览
Shitian Zhao Qilong Wu Xinyue Li Bo Zhang Ming Li Qi Qin Dongyang Liu Kaipeng Zhang Hongsheng Li Yu Qiao Peng Gao Bin Fu Zhen Li
文本生成 数据合成 深度学习 图像合成 评估指标

核心发现

方法论

LeX-Art采用数据驱动策略,基于Deepseek-R1优化提示,构建LeX-10K高质量数据集。通过多阶段筛选和知识增强的重述,确保图像与文本的高对齐度。训练LeX-FLUX和LeX-Lumina两个模型,结合LeX-Enhancer进行提示增强,显著提升文本渲染效果。引入LeX-Bench和PNED指标,系统评估生成质量。实验显示LeX-Lumina在CreateBench上PNED提升79.81%,LeX-FLUX在色彩、位置、字体准确率分别提升3.18%、4.45%、3.81%。

关键结果

  • LeX-Lumina在CreateBench上的PNED指标提升79.81%,显著优于现有模型,证明其在文本准确性方面的优势。
  • LeX-FLUX在色彩、位置和字体准确率上分别超越基线模型3.18%、4.45%、3.81%,显示出优异的文本属性控制能力。
  • 通过LeX-10K数据集的微调,模型在多样化复杂布局和多词场景中表现出更强的适应性和美学效果。

研究意义

本研究突破了以往依赖控制模块提升文本渲染的局限,提出数据驱动的高质量合成方案,为文本图像生成提供了系统性解决方案。其在设计、广告、艺术等行业具有广泛应用潜力,推动AI在视觉文本处理中的创新发展。模型的高效性和可扩展性,为未来多样化场景提供技术基础,具有重要的学术和工业价值。

技术贡献

提出基于Deepseek-R1的提示增强机制,结合多阶段筛选和知识重述,构建高质量数据集LeX-10K。微调LeX-FLUX和LeX-Lumina模型,显著提升文本渲染的准确性和美学效果。引入PNED作为文本准确性评估指标,增强模型评估的鲁棒性。整体框架突破了传统控制导向的限制,强调数据质量在模型性能中的核心作用。

新颖性

首次系统性利用深度提示增强和多阶段筛选策略,构建高质量文本图像数据集,显著改善非Glyph条件模型的文本渲染能力。引入PNED指标,突破了传统序列匹配的局限,为多场景文本评估提供新思路。这些创新在模型训练和评估体系中具有开创性意义。

局限性

  • 模型在极端复杂布局或极少样本场景下仍存在文本模糊或错位问题,主要受限于数据多样性和模型容量。
  • 高质量数据集的构建依赖大量人工筛选和知识重述,成本较高,难以快速扩展到更大规模。
  • 模型在多语言、多字体、多场景的泛化能力仍需进一步验证,未来需引入多模态多语种数据进行优化。

未来方向

未来将探索更高效的自动化数据增强和多模态融合技术,提升模型在多语言、多场景下的适应性。计划引入生成对抗网络(GAN)和强化学习,优化文本布局和风格控制。还将结合用户交互反馈,持续提升模型的实用性和美学表现。

AI 总览摘要

LeX-Art提出了一套系统性方案,旨在解决文本图像生成中文本渲染的瓶颈。通过利用Deepseek-R1优化提示,构建了LeX-10K高质量数据集,显著改善模型的文本属性控制能力。多阶段筛选和知识增强的重述机制确保数据的高质量和多样性,为模型微调提供坚实基础。

在模型方面,LeX-FLUX和LeX-Lumina通过微调LeX-10K数据,分别在高性能和轻量化场景中实现了优异表现。引入PNED指标,为文本准确性提供了更鲁棒的评估标准。实验结果显示,LeX-Lumina在CreateBench上的PNED提升79.81%,而LeX-FLUX在色彩、位置和字体准确率上也优于基线模型。

该研究不仅突破了传统控制导向的限制,还强调了数据质量在提升模型性能中的核心作用。其创新方法和评估体系,为未来多场景、多语言的文本生成提供了技术基础。整体而言,LeX-Art为视觉文本生成领域带来了新的突破,具有广泛的学术和工业应用前景。

深度分析

研究背景

随着深度学习的发展,文本到图像(T2I)模型已取得显著突破,代表性工作如Stable Diffusion、DALL·E等推动了高质量图像生成。然而,文本渲染仍面临准确性与美学的双重挑战,尤其在多词、多布局和复杂场景中表现不足。现有数据集如AnyWord-3M和MARIO-10M在多样性和高分辨率方面存在局限,导致模型在细节控制和视觉美感上难以兼顾。近年来,控制模块如GlyphControl、TextDiffuser等尝试引入glyph信息,但在多样性和自然融合方面仍有限。整体背景显示,提升文本渲染的关键在于高质量数据和模型微调策略的结合。

核心问题

核心问题在于现有模型难以在复杂布局、多词场景中实现高精度文本渲染,受限于数据质量和模型泛化能力。传统方法多依赖控制模块,导致生成缺乏自然美感和多样性,且在多语言、多字体环境下表现不佳。如何在保证文本准确的同时,提升整体美学和布局灵活性,成为亟待解决的难题。

核心创新

本研究提出三大创新:第一,基于Deepseek-R1的提示增强机制,丰富文本描述细节;第二,构建LeX-10K高质量数据集,通过多阶段筛选和知识重述确保数据多样性和准确性;第三,引入PNED指标,提升文本准确性评估的鲁棒性。这些创新结合数据驱动和模型微调,突破了以往依赖控制模块的局限,显著提升文本渲染质量。

方法详解

  • �� 利用Deepseek-R1对原始提示进行细粒度增强,加入字体、颜色、布局信息。
  • �� 通过多阶段筛选,包括Q-Align和Paddle-OCR,筛除低质量和不符合要求的图像。
  • �� 采用知识增强的GPT-4o重述文本,确保与图像内容高度一致。
  • �� 构建LeX-10K数据集,结合筛选和重述,确保高质量、多样性。
  • �� 微调LeX-FLUX(基于FLUX.1)和LeX-Lumina(基于Lumina-Image 2.0),提升文本渲染能力。
  • �� 引入PNED指标,用于评估生成文本与输入提示的匹配度,增强评估的全面性。

实验设计

采用LeX-10K作为微调数据,模型在CreateBench、SimpleBench和AnyText-Benchmark上进行评估。指标包括OCR Recall、PNED、CLIP Score和FID。设置训练参数如LeX-FLUX的学习率1e-6,批次256,训练6000步。通过对比Glyph条件模型,验证数据增强的有效性。还进行用户偏好和VQA评估,确保多维度性能。

结果分析

LeX-Lumina在CreateBench上PNED指标提升79.81%,显示出极强的文本准确性。LeX-FLUX在色彩、位置、字体准确率分别超越基线3.18%、4.45%、3.81%。模型在复杂布局、多词场景中表现优异,验证了高质量数据和微调策略的有效性。多项指标显示,本文提出的方法在保持自然美感的同时,大幅提升文本控制能力。

应用场景

该技术可广泛应用于广告设计、艺术创作、品牌标识、动态海报等场景,满足对高质量、多样化文本图像的需求。未来,结合多语种、多字体、多场景数据,将推动AI在视觉艺术和商业设计中的深度融合。

局限与展望

模型在极端复杂布局或极少样本场景下仍存在文本模糊或错位问题,主要受限于数据多样性和模型容量。高质量数据集的构建成本较高,难以快速扩展。未来需优化模型结构和多模态数据融合,提升泛化能力。

通俗解读 非专业人士也能看懂

想象你在一家厨房做菜,食材代表数据,厨师代表模型。过去,厨师只能用有限的食材做出普通菜肴,效果不够漂亮也不够美味。现在,厨师得到了一份特别的食谱(高质量数据集),配料更丰富,步骤更详细。厨师按照新食谱,经过多次试验和调整,做出色香味俱佳的菜肴(高质量文本图像)。这个过程就像用LeX-Art的方法,通过优化提示和筛选,确保每一道菜都色彩鲜明、布局合理、味道鲜美。最终,这家厨房能做出各种复杂、精美的菜肴,满足不同顾客的需求。

简单解释 像给14岁少年讲一样

想象你在玩拼图游戏,目标是拼出一幅漂亮的画。以前,拼图的图片不够清楚,拼出来的画总是模糊或错位。现在,有了新方法,就像给拼图图片加了标签和说明,让每块拼图都能准确拼到正确位置。科学家们用一种叫LeX-Art的技术,先用特别聪明的算法把提示变得更详细,再筛选出最清晰、最漂亮的图片。接着,他们训练两个“拼图师”模型,一个专注于高质量拼图(LeX-FLUX),另一个则更快、更轻便(LeX-Lumina)。他们还发明了一个新标准(PNED),用来判断拼图是否拼得像原图一样。结果显示,这些新技术能让拼出来的画既漂亮又准确,比以前的拼图效果好多了。就像你用更聪明的拼图指南,拼出了最棒的画!

术语表

Deepseek-R1 (深度搜索R1)

一种基于深度学习的提示增强模型,能生成细粒度的文本描述,提升图像生成的细节丰富度。它在本研究中用于优化提示内容。

用来增强提示,改善文本描述的细节,提升生成图像的文本渲染效果。

LeX-10K (高质量数据集)

由多阶段筛选和知识重述构建的10,000个高分辨率文本图像对,确保文本内容与图像高度一致,提升模型训练效果。

作为微调模型和评估的基础数据集,显著改善文本渲染质量。

PNED (配对归一化编辑距离)

一种评估文本匹配度的指标,考虑词集无序匹配,能更鲁棒地反映生成文本与输入提示的相似性。

用于衡量模型生成文本的准确性,优于传统序列匹配指标。

LeX-FLUX (模型)

基于FLUX.1的微调模型,专注于高保真文本渲染,兼顾效果与效率。

在LeX-10K基础上训练,用于提升复杂场景中的文本生成能力。

LeX-Lumina (模型)

轻量化文本图像生成模型,适合部署,性能略逊于LeX-FLUX,但在效率方面表现优异。

满足多场景、多设备的实际应用需求。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升模型在极端复杂布局和多语言环境下的文本渲染一致性仍未解决,尤其在多模态、多场景融合方面仍需探索。
  • 2 大规模高质量数据集的自动化生成与筛选技术尚不成熟,成本较高,限制了模型的普及和扩展。
  • 3 模型在多语种、多字体、多文化背景下的泛化能力仍需验证,未来需引入多模态、多语种训练数据。

应用场景

近期应用

广告与品牌设计

利用LeX-Art生成具有丰富文本属性的广告海报和品牌标识,提升视觉冲击力和信息传达效果。

艺术创作与个性化定制

为艺术家和设计师提供高质量文本图像素材,支持个性化字体、布局和色彩,丰富创作手段。

远期愿景

多模态智能内容生成平台

结合LeX-Art技术,打造自动化、多场景、多语言的内容生成平台,推动数字媒体和虚拟现实的发展。

原文摘要

We introduce LeX-Art, a comprehensive suite for high-quality text-image synthesis that systematically bridges the gap between prompt expressiveness and text rendering fidelity. Our approach follows a data-centric paradigm, constructing a high-quality data synthesis pipeline based on Deepseek-R1 to curate LeX-10K, a dataset of 10K high-resolution, aesthetically refined 1024$\times$1024 images. Beyond dataset construction, we develop LeX-Enhancer, a robust prompt enrichment model, and train two text-to-image models, LeX-FLUX and LeX-Lumina, achieving state-of-the-art text rendering performance. To systematically evaluate visual text generation, we introduce LeX-Bench, a benchmark that assesses fidelity, aesthetics, and alignment, complemented by Pairwise Normalized Edit Distance (PNED), a novel metric for robust text accuracy evaluation. Experiments demonstrate significant improvements, with LeX-Lumina achieving a 79.81% PNED gain on CreateBench, and LeX-FLUX outperforming baselines in color (+3.18%), positional (+4.45%), and font accuracy (+3.81%). Our codes, models, datasets, and demo are publicly available.

cs.CV