VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?

TL;DR

VISTA-Bench揭示视觉化文本与纯文本模型的显著模态差距,基于多任务评估模型理解能力。

cs.CV 🔴 高级 2026-02-05 50 次浏览
Qing'an Liu Juntong Feng Yuhao Wang Xinzhe Han Yujie Cheng Yue Zhu Haiwen Diao Yunzhi Zhuge Huchuan Lu
多模态理解 视觉-语言模型 模态差距 基准测试 视觉化文本

核心发现

方法论

采用系统化构建的VISTA-Bench,结合多模态感知、推理和纯模态理解任务,通过严格的渲染控制和VLM验证,评估30余个代表性模型在纯文本与视觉化文本条件下的性能差异。数据集涵盖多层次任务,从感知到推理再到知识应用,确保对模型能力的全面诊断。

关键结果

  • 大部分模型在纯文本任务中表现优异,但在视觉化文本条件下性能显著下降,平均性能差距达15%以上。特别是OCR能力较弱的模型,如NEO-9B-SFT,性能下降高达31%。而MiMo-VL-7B-RL表现出较强鲁棒性,差距仅为0.3%。
  • 渲染难度增加(如字体大小、风格变化)会放大模态差距,模型对视觉细节的敏感性成为限制因素。模型的视觉文本识别能力与模态差距密切相关,识别能力越强,差距越小。
  • 多任务分析显示,推理和知识任务的模态差距更大,表明视觉文本的理解不仅依赖感知,还涉及复杂的跨模态推理能力。

研究意义

该研究系统揭示了当前视觉-语言模型在处理视觉化文本时的局限性,强调了模型在跨模态语义保持和鲁棒性方面的不足。为未来统一多模态表示提供了诊断工具,有助推动模型在实际场景中的应用,如图像内嵌文本理解、自动文档分析等,具有重要的学术和工业价值。

技术贡献

提出VISTA-Bench,构建了涵盖感知、推理、知识等多层次任务的视觉化文本评估体系,采用LaTeX渲染管线和VLM验证确保数据质量。通过大规模模型评估,系统分析模态差距的根源,强调感知鲁棒性和视觉文本识别能力的关键作用,为多模态统一表示提供理论基础和工程实践路径。

新颖性

首次系统性地在多任务、多模态场景中评估视觉化文本理解能力,突破传统纯文本评估范式,提出严格控制的渲染和验证流程,揭示模型在视觉文本处理中的模态差异,为多模态统一表示研究提供新视角。

局限性

  • 当前评估主要集中在静态渲染文本,未充分考虑动态场景和复杂交互环境下的模型表现。模型对极端渲染变化的鲁棒性仍需提升,特别是在字体风格和布局多样性方面。
  • 渲染质量虽经过验证,但仍存在一定误差,可能影响模型性能的真实反映。未来需引入更丰富的渲染策略和多模态交互场景。
  • 模型多样性有限,未来应扩展到更多新兴模型和更复杂任务,以全面理解模态差距的动态演变。

未来方向

未来将探索多模态融合机制,提升模型对视觉化文本的理解鲁棒性。计划引入动态渲染和场景复杂度变化,丰富评估维度。同时,推动模型在实际应用中的迁移能力研究,如多模态问答、图像内嵌文本识别等,促进多模态统一表示的理论突破。

AI 总览摘要

随着视觉-语言模型(VLMs)在多模态理解中的快速发展,学界和工业界对其能力的全面评估变得尤为重要。传统评估多依赖纯文本任务,忽视了在现实场景中语言常以视觉化文本嵌入图像的形式出现的事实。本文提出VISTA-Bench,系统性构建了一个涵盖感知、推理和知识应用的多任务评估体系,专门测试模型在纯文本与视觉化文本条件下的表现差异。通过严格的渲染控制和VLM验证,评估了30余个主流模型,发现绝大多数模型在视觉文本条件下性能显著下降,模态差距普遍在15%以上,部分模型下降甚至超过30%。特别是OCR能力较弱的模型表现出更大差距,验证了视觉文本识别的关键作用。研究还揭示,字体大小、风格等渲染参数对模型性能影响巨大,模型对视觉细节的敏感性成为限制因素。推理和知识任务的模态差距尤为明显,表明视觉文本理解不仅依赖感知能力,还涉及复杂的跨模态推理。该工作为未来多模态统一表示提供了重要的诊断工具,强调提升视觉文本识别和感知鲁棒性是关键。未来,研究将聚焦于增强模型的跨模态融合能力,优化渲染策略,推动多模态理解在实际场景中的应用落地。总体而言,VISTA-Bench为多模态理解提供了新的评估范式,促使模型在视觉化文本理解方面迈向更高的统一性和鲁棒性。

深度解读

原文摘要

Vision-Language Models (VLMs) have achieved impressive performance in cross-modal understanding across textual and visual inputs, yet existing benchmarks predominantly focus on pure-text queries. In real-world scenarios, language also frequently appears as visualized text embedded in images, raising the question of whether current VLMs handle such input requests comparably. We introduce VISTA-Bench, a systematic benchmark from multimodal perception, reasoning, to unimodal understanding domains. It evaluates visualized text understanding by contrasting pure-text and visualized-text questions under controlled rendering conditions. Extensive evaluation of over 30 representative VLMs reveals a pronounced modality gap: models that perform well on pure-text queries often degrade substantially when equivalent semantic content is presented as visualized text. This gap is further amplified by increased perceptual difficulty, highlighting sensitivity to rendering variations despite unchanged semantics. Overall, VISTA-Bench provides a principled evaluation framework to diagnose this limitation and to guide progress toward more unified language representations across tokenized text and pixels. The source dataset and code are publicly available at https://github.com/QingAnLiu/VISTA-Bench.

cs.CV