Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models

TL;DR

Vary方法扩展视觉词汇,实现DocVQA 78.2% ANLS和MMVet 36.2%。

cs.CV 🔴 高级 2023-12-11 1 次浏览
Haoran Wei Lingyu Kong Jinyue Chen Liang Zhao Zheng Ge Jinrong Yang Jianjian Sun Chunrui Han Xiangyu Zhang
视觉语言模型 词汇扩展 OCR 深度学习 多模态

核心发现

方法论

Vary通过生成和整合新视觉词汇扩展LVLMs的视觉词汇。首先使用词汇网络和小型解码器生成新词汇,然后与原有CLIP词汇融合,提升模型的细粒度感知能力。

关键结果

  • Vary在DocVQA中取得78.2%的ANLS,显著优于现有方法。
  • 在MMVet中,Vary实现了36.2%的总分,展示了其在多场景下的强大性能。
  • 通过实验,Vary在文档解析任务中表现出色,特别是在OCR和markdown转换方面。

研究意义

Vary通过扩展视觉词汇,解决了CLIP在非英语场景下的词汇不足问题,提升了LVLMs在细粒度视觉任务中的表现。这一方法为视觉语言模型的进一步发展提供了新的思路。

技术贡献

Vary提出了一种新颖的视觉词汇扩展方法,结合了自动回归生成和词汇融合技术,显著提升了LVLMs的细粒度感知能力。

新颖性

Vary首次提出通过生成新视觉词汇并与CLIP融合的方式扩展LVLMs的视觉词汇,解决了现有模型在非英语场景下的词汇不足问题。

局限性

  • Vary在高分辨率图像处理上仍有提升空间,特别是在复杂场景下。
  • 新词汇生成过程可能需要大量计算资源。

未来方向

未来可探索更高效的词汇生成方法,优化计算资源使用,并扩展至更多语言和视觉任务。

AI 总览摘要

现代大型视觉语言模型(LVLMs)通常依赖CLIP作为视觉词汇,但在需要密集和细粒度视觉感知的任务中,尤其是非英语场景下,CLIP的效率较低。为解决这一问题,本文提出了Vary,一种有效扩展LVLMs视觉词汇的方法。Vary通过生成新视觉词汇并与CLIP融合,提升了模型的细粒度感知能力。

Vary的核心技术包括词汇网络和小型解码器,通过自动回归生成新词汇,并与原有词汇融合。实验表明,Vary在DocVQA中实现了78.2%的ANLS,在MMVet中取得了36.2%的总分,显著优于现有方法。

尽管Vary在多场景下表现出色,但在处理高分辨率图像时仍有提升空间。未来的研究可以探索更高效的词汇生成方法,进一步优化模型性能。

深度分析

研究背景

视觉语言模型近年来发展迅速,CLIP作为通用视觉词汇被广泛应用。然而,CLIP在处理非英语场景和高分辨率图像时效率较低,成为LVLMs发展的瓶颈。

核心问题

CLIP在非英语场景下的词汇不足导致视觉信息编码效率低下,影响了LVLMs在细粒度视觉任务中的表现。

核心创新

Vary通过生成新视觉词汇并与CLIP融合,解决了现有模型在非英语场景下的词汇不足问题,显著提升了细粒度感知能力。

方法详解

  • �� 使用词汇网络和小型解码器生成新视觉词汇。
  • �� 将新词汇与CLIP融合,扩展视觉词汇。
  • �� 通过冻结词汇网络,避免视觉知识被覆盖。

实验设计

实验在DocVQA和MMVet数据集上进行,使用LLaVA-80k和LLaVA-CC665k作为SFT数据,评估Vary在不同任务中的表现。

结果分析

Vary在DocVQA中取得78.2% ANLS,在MMVet中实现36.2%的总分,显著优于现有方法。

应用场景

Vary可应用于文档解析、OCR和图表理解等任务,特别适用于非英语场景。

局限与展望

Vary在高分辨率图像处理上仍有提升空间,未来可探索更高效的词汇生成方法。

通俗解读 非专业人士也能看懂

想象你在一个图书馆中,CLIP是一本百科全书,涵盖了大部分常见的知识,但对于一些特定的主题,比如非英语书籍,它可能没有足够的信息。Vary就像是为这本百科全书增加了新的章节,专门介绍这些特定主题。通过这种方式,图书馆可以更好地帮助你找到所需的信息。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,游戏里有一个机器人助手,它可以帮你识别游戏中的各种物品。但当你进入一个新关卡,里面有很多外国文字时,助手就不太管用了。Vary就像是给这个助手升级,让它能识别更多种类的文字和图像,这样你就能更顺利地通过关卡啦!

术语表

CLIP

一种通用视觉词汇,广泛用于视觉语言模型中。

CLIP在Vary中作为原始视觉词汇使用。

LVLMs

大型视觉语言模型,结合视觉和语言处理能力。

Vary旨在提升LVLMs的细粒度感知能力。

DocVQA

文档视觉问答数据集,用于评估模型的文档解析能力。

Vary在DocVQA中取得了78.2%的ANLS。

MMVet

多模态评估工具,用于测试模型的综合性能。

Vary在MMVet中实现了36.2%的总分。

自动回归

一种生成序列数据的方法,通过预测下一个元素来生成序列。

Vary使用自动回归生成新视觉词汇。

开放问题 这项研究留下的未解疑问

  • 1 如何在不增加计算复杂度的情况下进一步扩展视觉词汇?
  • 2 如何优化新词汇生成过程以适应更多语言和任务?

应用场景

近期应用

文档解析

Vary可用于提高OCR和文档解析的准确性,特别是在非英语场景下。

远期愿景

多语言支持

通过扩展视觉词汇,Vary有潜力支持更多语言的视觉任务,推动全球化应用。

原文摘要

Modern Large Vision-Language Models (LVLMs) enjoy the same vision vocabulary -- CLIP, which can cover most common vision tasks. However, for some special vision task that needs dense and fine-grained vision perception, e.g., document-level OCR or chart understanding, especially in non-English scenarios, the CLIP-style vocabulary may encounter low efficiency in tokenizing the vision knowledge and even suffer out-of-vocabulary problem. Accordingly, we propose Vary, an efficient and effective method to scale up the vision vocabulary of LVLMs. The procedures of Vary are naturally divided into two folds: the generation and integration of a new vision vocabulary. In the first phase, we devise a vocabulary network along with a tiny decoder-only transformer to produce the desired vocabulary via autoregression. In the next, we scale up the vanilla vision vocabulary by merging the new one with the original one (CLIP), enabling the LVLMs can quickly garner new features. Compared to the popular BLIP-2, MiniGPT4, and LLaVA, Vary can maintain its vanilla capabilities while enjoying more excellent fine-grained perception and understanding ability. Specifically, Vary is competent in new document parsing features (OCR or markdown conversion) while achieving 78.2% ANLS in DocVQA and 36.2% in MMVet. Our code will be publicly available on the homepage.

cs.CV