Any2Poster: Any-Source Poster Generation Across Modalities and Domains

TL;DR

提出Any2Poster方法,支持跨模态多源内容生成海报,平均准确率达87.25%。

cs.CV 🔴 高级 2026-06-02 3 引用 43 次浏览
Amogh Vinaykumar Aiden Li Suozhi Huang Shilong Liu
多模态学习 自动排版 视觉理解 跨域生成 深度学习

核心发现

方法论

本文提出了Any2Poster框架,结合统一解析、内容自适应布局规划和基于HTML/CSS的渲染技术,利用多模态预训练模型(如VLM)实现跨源内容的结构化理解与视觉生成。系统包括六个关键阶段:源内容解析(支持PDF、网页、PPTX、DOCX、Markdown、LaTeX、笔记本和视频)、内容分析与布局规划、HTML/CSS渲染、视觉修正。通过引入VLM引导的局部修复机制,实现对排版溢出、视觉比例等问题的优化。评估采用Any2Poster Bench,结合Quiz式问答和VLM判定,确保信息保真与视觉质量。实验中,系统在8个输入模态和5个内容域上均表现优异,平均准确率达87.25%。

关键结果

  • 在跨模态评估中,Any2Poster Agent在8个输入模态上达到了87.25%的平均准确率,显著优于GPT-4o(74.00%)和Paper2Poster(58.30%),尤其在Markdown和LaTeX输入中超过93%。
  • 在跨域评估中,系统在研究、新闻、教育、商业和虚构内容域的平均准确率为87.28%,优于基线模型,显示出强泛化能力。
  • 在PaperQuiz风格的评估中,系统的整体准确率由之前的51.06-51.33%提升至72.58%,密度增强得分达145.16,优于之前的PosterAgent-4o(51.33%、121分),验证了信息保真与视觉表现的提升。

研究意义

该研究突破了以往仅针对论文或单一模态的海报生成限制,提出支持多模态、多域的通用生成框架,为自动化科学传播、教育展示和商业报告提供了新的技术路径。通过引入结构化理解和视觉修复机制,有效解决了多源信息整合、排版布局和视觉优化的难题,推动了多模态AI在复杂内容表达中的应用落地。其评估体系的建立,为未来多源内容自动转化为高质量视觉传播材料提供了标准化工具,有望大幅提升内容生产效率和传播效果。

技术贡献

本文的核心技术贡献在于提出了Any2Poster框架,融合了多模态结构化解析、内容自适应布局规划和基于HTML/CSS的可编辑渲染技术。创新点包括:• 统一多模态内容解析器,支持PDF、网页、演示文稿等多源输入;• 引入内容感知的布局规划算法,动态分配版块角色和视觉元素;• 利用轻量级VLM引导的局部修复机制,提升排版和视觉比例的精细调控。该系统实现了端到端的自动化流程,显著优于传统基于模板或单一模态的生成方法。

新颖性

本研究的创新在于首次提出支持八种不同输入模态的通用海报生成框架,突破了以往只针对学术论文或单一格式的限制。通过结构化解析、内容自适应布局和HTML/CSS渲染的结合,实现了跨模态、跨域的高效内容转化。引入VLM引导的局部修复机制,增强了生成的排版质量和视觉一致性。这些创新使得系统在多样化内容源和应用场景中表现出优异的泛化能力,填补了多模态、多域自动海报生成的研究空白。

局限性

  • 系统在处理极端结构化不足或内容过于稀疏的源时,可能无法生成符合预期的海报,表现出一定的鲁棒性不足。
  • 对复杂多变的视觉元素(如动态图像或高复杂度图表)支持有限,渲染效果仍有提升空间。
  • 在大规模应用中,模型的计算成本较高,特别是在多模态解析和VLM引导修复环节,可能影响实时性。

未来方向

未来将致力于提升多模态解析的鲁棒性,增强对动态图像和复杂图表的支持,优化模型的推理速度。同时,计划引入用户交互机制,使生成的海报更具个性化和定制化,拓展到更多实际应用场景如会议、展览和在线教育平台。进一步结合强化学习优化布局策略,提升整体生成质量和效率。

AI 总览摘要

在信息爆炸的时代,如何高效、准确地将复杂内容转化为直观、吸引人的视觉传播材料,成为学术界和工业界共同面对的挑战。传统的海报生成方法多依赖模板或单一模态,难以应对多样化的内容源和应用需求。本文提出了Any2Poster框架,旨在实现跨模态、多域的自动海报生成,突破了现有技术的局限。

该系统由三个核心部分组成:统一解析、多源内容理解与结构化、内容自适应布局规划,以及基于HTML/CSS的可编辑渲染。通过引入多模态预训练模型(如Visual-Language Models, VLM),系统不仅能理解多源内容的结构和语义,还能在生成过程中进行局部修复,确保排版合理、视觉协调。

实验结果显示,Any2Poster在8个输入模态和5个内容域上均表现出色,平均准确率达87.25%,在跨模态和跨域任务中均优于现有的主流模型。特别是在PaperQuiz风格的评估中,系统的整体准确率从之前的50%左右提升到72.58%,密度得分也显著提高。这表明系统不仅能准确提取信息,还能有效地进行视觉表达。

该研究的意义在于为多模态内容理解与视觉传播提供了新的技术路径。它解决了多源信息整合、排版布局和视觉优化的难题,为自动化科学传播、教育展示和商业报告提供了强有力的工具。未来,系统将继续优化多模态解析能力,提升生成速度,并引入用户交互,推动多源内容自动转化为高质量视觉材料的广泛应用。

深度分析

研究背景

随着深度学习和多模态预训练模型的发展,自动内容理解与视觉生成技术取得了显著进步。早期工作如PosterBot、Paper2Poster等,主要针对学术论文的自动排版与摘要,依赖模板和规则,局限于科学论文领域。近年来,视觉语言模型(如CLIP、ALIGN)推动了多模态理解的突破,使得模型可以跨模态理解内容关系。与此同时,自动排版和视觉渲染技术也在不断演进,从简单的模板匹配到基于深度学习的端到端系统。尽管如此,现有方法多局限于单一模态(如论文PDF)或单一领域(如科研),难以满足实际多源、多场景的需求。多模态、多域的海报生成仍是一个未充分解决的难题,尤其是在内容丰富、结构复杂、视觉效果多样的实际应用中。

核心问题

核心问题在于如何设计一个能够跨越多模态、多领域的统一框架,实现从多源内容到高质量视觉海报的自动转化。具体挑战包括:• 多模态内容解析:不同格式(PDF、网页、演示文稿等)结构差异大,需统一解析为结构化表示;• 内容理解与筛选:提取关键信息,避免信息遗漏或冗余;• 排版布局:根据内容自适应设计合理的版块结构和视觉层次;• 视觉生成与修复:确保排版美观、信息完整且视觉协调。传统方法多依赖模板或规则,难以应对多样化内容和复杂场景,亟需一种端到端、泛用性强的解决方案。

核心创新

本研究的创新点主要体现在以下几个方面:1)多模态统一解析:引入多模态预训练模型,支持PDF、网页、PPTX、DOCX、Markdown、LaTeX、笔记本和视频的结构化解析,形成统一的内容表示;2)内容感知的布局规划:根据内容类型和重要性,动态分配版块角色和视觉元素,实现自适应排版;3)基于HTML/CSS的渲染:采用代码驱动的渲染方式,支持字符级别的排版控制和视觉修正,提升可编辑性和精细调控能力;4)VLM引导的局部修复:利用视觉语言模型进行视觉溢出、比例等局部问题的修正,增强生成质量。这些创新结合,使得系统能够高效处理多源、多场景的内容转化。

方法详解

  • �� 统一解析:采用专用解析器将不同格式的源内容(PDF、网页、PPTX等)转换为结构化的ParsedDocument,包括段落、图表、表格和原始文本;• 内容分析与布局规划:对解析结果进行内容重要性评估,预测标题、核心信息和版块角色,采用内容感知的布局算法(如图形-文本匹配、视觉优先级排序)安排版块位置;• 视觉元素选择:保留高质量源图像或生成新视觉,依据分辨率和相关性筛选,确保内容完整性;• HTML/CSS渲染:将每个版块转化为HTML块,结合CSS样式实现排版,支持字符级调节和图像嵌入;• 视觉修正:利用VLM引导的局部编辑,检测排版溢出、比例失衡等问题,进行针对性修复并重新渲染;• 生成输出:导出PDF和PNG格式的最终海报,支持用户交互和后续编辑。

实验设计

实验采用Any2Poster Bench,涵盖8个模态(PDF、网页、PPTX、DOCX、Markdown、LaTeX、笔记本、视频)和5个内容域(科研、新闻、教育、商业、虚构)。每个实例生成20个事实性和20个理解性多项选择题,利用VLM作为答题和判定工具,评估信息保真和视觉质量。对比基线模型包括GPT-4o、Gemini 2.5 Flash和GPT-5,重点衡量quiz准确率和VLM判定得分。系统在不同模态和域上的表现被详细统计,验证了其强泛化能力。还进行了消融实验,分析不同模块对性能的贡献,确保系统的鲁棒性和实用性。

结果分析

系统在8个输入模态的平均quiz准确率为87.25%,在Markdown和LaTeX中超过93%,显示出极强的模态适应能力。跨域评估中,平均准确率达87.28%,在研究、新闻、教育、商业和虚构内容中表现均优于对比模型。PaperQuiz风格的评估中,整体准确率由之前的50%左右提升到72.58%,密度得分达145.16,显著优于PosterAgent-4o(51.33%、121分)。这些结果验证了系统在信息提取、布局设计和视觉表达方面的有效性,特别是在多源、多场景的复杂内容中表现出优异的泛化能力。

应用场景

该技术可广泛应用于学术会议、科研报告、企业展示、在线教育和公共信息传播等场景。用户只需提供多源内容,系统即可自动生成高质量海报,极大提升内容制作效率。特别适合需要快速制作多样化视觉材料的行业,如科研机构、媒体公司和教育平台。未来还可结合交互式编辑,支持个性化定制,满足不同用户的需求。长远来看,系统有望成为内容自动化生成和智能化传播的重要工具,推动数字内容的高效生产与传播。

通俗解读 非专业人士也能看懂

想象你在准备一场学校的展览,你有很多不同的资料,比如科学论文、网页、幻灯片、手写笔记和视频。每种资料都像不同的拼图碎片,内容丰富但格式各异。你需要把这些拼图拼成一张漂亮的海报,让大家一眼就能明白你的主题。传统方法就像用模板拼图,只能拼特定的拼图,不能应对不同的资料。而这项新技术就像有一台神奇的拼图机,它能理解各种不同的碎片,自动整理出一张漂亮的海报。它会分析每个资料的重点,把重要的内容放大,排版得整整齐齐,还能自动修正排版中的问题,比如文字太挤或图片比例不对。最终,你只需要提供资料,这台拼图机就能帮你做出一张专业、漂亮的海报,省时又省力,让你的展览更吸引人。

简单解释 像给14岁少年讲一样

想象你在学校准备一个展示板,你有很多不同的资料,比如科学论文、网页、PPT、笔记和视频。每个资料都像不同的拼图块,有的长,有的短,有的内容很复杂。你想把它们拼成一张漂亮的海报,让别人一看就明白你的主题。以前,你得用模板,把每个资料都按一样的格式排好,非常麻烦。而现在,有了这个新技术,就像有一台超级智能的拼图机器人,它可以理解各种不同的资料,把重要的内容提取出来,然后自动帮你排版,设计出一张漂亮的海报。它还能修正排版中的问题,比如文字太挤或图片比例不对。你只需要把资料交给它,它就能帮你做出一份专业的海报,节省了很多时间,也让你的展示更吸引人。

术语表

Visual-Language Model (VLM) (视觉语言模型)

一种结合视觉和语言理解能力的深度学习模型,能同时处理图像和文本信息,用于多模态内容理解与生成。

在本文中,VLM用于引导局部修复和视觉质量判定。

结构化解析 (Structured Parsing)

将多模态源内容转换为统一的结构化表示,包括段落、图表、表格和文本块,便于后续处理。

系统的第一步是实现多源内容的结构化解析。

内容自适应布局 (Content-Adaptive Layout)

根据内容的重要性和类型,动态规划版块位置和视觉元素,实现个性化排版。

用于提升海报的可读性和视觉效果。

HTML/CSS渲染 (HTML/CSS Rendering)

采用网页前端技术,将排版内容转化为可编辑的网页格式,支持字符级调节和视觉修正。

实现海报的高精度排版和局部修复。

局部修复 (Localized Repair)

利用VLM引导对排版溢出、比例失衡等问题进行局部调整,优化视觉效果。

提升生成海报的整体质量。

BenchQuiz

一种基于问答的评估协议,用于检测生成海报中信息的保真度和理解度。

确保海报传达了源内容的关键信息。

多模态预训练模型 (Multimodal Pretrained Models)

在大量多模态数据上预训练的深度学习模型,具备跨模态理解能力。

支持多源内容的统一解析。

端到端系统 (End-to-End System)

从输入到输出全部由一个模型或流程自动完成,无需人工干预。

实现自动化海报生成流程。

开放问题 这项研究留下的未解疑问

  • 1 当前系统在处理极端结构化不足或内容过于稀疏的源时,表现仍有限,未来需要增强对非结构化内容的理解能力。
  • 2 对动态图像、交互式内容和高复杂度图表的支持尚不充分,如何扩展模型能力以涵盖更多视觉元素,是未来的研究方向。
  • 3 模型的计算成本较高,尤其在多模态解析和修复环节,实时性和规模化应用仍面临挑战,需优化算法效率。
  • 4 缺乏对多语言、多文化背景内容的支持,未来应考虑多语种、多文化的适应性。
  • 5 用户交互和个性化定制能力有限,未来可以结合用户反馈进行动态调整和优化。

应用场景

近期应用

学术会议海报自动生成

研究人员只需上传论文或资料,系统即可自动生成专业海报,提升会议准备效率。

企业市场报告快速可视化

企业可以将财务、市场等数据资料输入系统,快速得到美观、信息丰富的展示海报。

在线教育内容自动排版

教育平台上传课程资料,系统自动生成配套的视觉海报,用于课程推广和学习资料展示。

远期愿景

智能内容传播平台

未来可构建全自动化的内容生成与传播生态系统,实现多源内容的快速可视化与分发。

个性化定制与交互式展示

结合用户偏好,提供定制化海报设计,支持交互式编辑与实时反馈,提升用户体验。

原文摘要

Visual posters are a compact medium for communicating dense information, yet progress on automatic poster generation remains difficult to measure because existing evaluations are often restricted to paper-only inputs, narrow domains, or surface-level visual similarity. We introduce Any2Poster Bench, a benchmark for any-source poster generation that evaluates systems across eight input modalities--PDFs, URLs, PPTX, DOCX, Markdown, LaTeX, notebooks, and videos--and five content domains. Any2Poster Bench pairs each source with quiz-based probes of verbatim factual retention and interpretive understanding, together with VLM-based judgments of visual quality, layout, readability, content completeness, and logical flow, enabling reproducible assessment of both information fidelity and visual communication. To instantiate and validate this benchmark, we further present Any2Poster Agent, an end-to-end reference agent that parses heterogeneous sources, organizes salient content, plans poster layouts, renders posters, and iteratively refines them using visual feedback. On Any2Poster Bench, Any2Poster Agent achieves 87.25% average accuracy across input modalities and 87.28% across content domains. On PaperQuiz-style evaluation, where prior paper-to-poster agents are directly comparable, Any2Poster Agent improves over PosterAgent-4o from 51.06-51.33% to 72.58% overall accuracy and from 116-121 to 145.16 in density-augmented score. Together, Any2Poster Bench and Any2Poster Agent provide a reusable evaluation resource and a competitive baseline for studying multimodal, domain-general poster generation.

cs.CV

参考文献 (20)

D2S: Document-to-Slide Generation Via Query-Based Text Summarization

Edward Sun, Yufang Hou, Dakuo Wang 等

2021 68 引用 查看解读 →

ART: Automatic multi-step reasoning and tool-use for large language models

Bhargavi Paranjape, Scott M. Lundberg, Sameer Singh 等

2023 224 引用 查看解读 →

Toolformer: Language Models Can Teach Themselves to Use Tools

Timo Schick, Jane Dwivedi-Yu, Roberto Dessì 等

2023 5218 引用 查看解读 →

PAL: Program-aided Language Models

Luyu Gao, Aman Madaan, Shuyan Zhou 等

2022 812 引用 查看解读 →

ReAct: Synergizing Reasoning and Acting in Language Models

Shunyu Yao, Jeffrey Zhao, Dian Yu 等

2022 10423 引用 查看解读 →

PosterBot: A System for Generating Posters of Scientific Papers with Neural Models

Sheng Xu, Xiaojun Wan

2022 22 引用

Text2Poster: Laying Out Stylized Texts on Retrieved Images

Chuhao Jin, Hongteng Xu, Ruihua Song 等

2022 12 引用 查看解读 →

Data Cards: Purposeful and Transparent Dataset Documentation for Responsible AI

Mahima Pushkarna, Andrew Zaldivar, Oddur Kjartansson

2022 368 引用 查看解读 →

SlideGen: an abstractive section-based slide generator for scholarly documents

Athar Sefid, P. Mitra, C. Lee Giles

2021 17 引用

G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment

Yang Liu, Dan Iter, Yichong Xu 等

2023 2944 引用 查看解读 →

PubLayNet: Largest Dataset Ever for Document Layout Analysis

Xu Zhong, Jianbin Tang, Antonio Jimeno-Yepes

2019 651 引用 查看解读 →

GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering

Drew A. Hudson, Christopher D. Manning

2019 3379 引用

Datasheets for datasets

Timnit Gebru, Jamie H. Morgenstern, Briana Vecchione 等

2018 3357 引用 查看解读 →

Learning to Generate Posters of Scientific Papers by Probabilistic Graphical Models

Yuting Qiang, Yanwei Fu, Xiao Yu 等

2017 43 引用 查看解读 →

VQA: Visual Question Answering

Aishwarya Agrawal, Jiasen Lu, Stanislaw Antol 等

2015 6652 引用 查看解读 →

PosterGen: Aesthetic-Aware Paper-to-Poster Generation via Multi-Agent LLMs

Zhilin Zhang, Xiang Zhang, Jiaqi Wei 等

2025 25 引用

Presentations by the Humans and For the Humans: Harnessing LLMs for Generating Persona-Aware Slides from Documents

I. Mondal, S. S, Anandhavelu Natarajan 等

2024 41 引用

Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering

Chenglei Si, Yanzhe Zhang, Ryan Li 等

2024 152 引用 查看解读 →

PosterSum: A Multimodal Benchmark for Scientific Poster Summarization

Rohit Saxena, Pasquale Minervini, Frank Keller

2025 12 引用 查看解读 →

OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning

Pan Lu, Bowen Chen, Sheng Liu 等

2025 71 引用 查看解读 →

被引用 (3)

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

PosterMELD: Multi-Agent Paper-to-Poster Generation for Controllable Design Diversity with Editable Print-Ready Outputs

ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog

2026 1 引用 查看解读 →