InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model

TL;DR

PLoRA仅适配图像令牌;基于InternLM2-7B,提升自由式图文创作与理解。

cs.CV 🟡 进阶级 2024-01-30 30 次浏览
Xiaoyi Dong Pan Zhang Yuhang Zang Yuhang Cao Bin Wang Linke Ouyang Xilin Wei Songyang Zhang Haodong Duan Maosong Cao Wenwei Zhang Yining Li Hang Yan Yang Gao Xinyue Zhang Wei Li Jingwen Li Kai Chen Conghui He Xingcheng Zhang Yu Qiao Dahua Lin Jiaqi Wang
视觉语言模型 多模态理解 图文生成 LoRA InternLM-XComposer2

核心发现

方法论

InternLM-XComposer2以InternLM2-7B为语言骨干,将视觉输入映射为可插入语言序列的图像令牌,并采用Partial LoRA(PLoRA):额外的低秩适配参数只作用于图像令牌,而不改动文本令牌路径。该设计同时支持大语言模型的长文本能力、视觉理解和交错式图文生成。

关键结果

  • 论文报告模型能依据提纲、详细文字规格和参考图像,生成可定制的长篇交错图文内容;但所给摘要未公布具体胜率、BLEU、CIDEr或人工评分数值。
  • 在多项视觉语言理解基准上,作者称7B模型显著超过现有多模态模型,并在部分评测中达到或超过GPT-4V与Gemini Pro;原文摘要未列出各数据集的分数表。
  • PLoRA的核心观察是:仅调整图像令牌可减少视觉适配对预训练语言知识和文风能力的干扰,从而兼顾视觉精确性与长文本表达;摘要未提供独立消融数值。

研究意义

该工作把多模态模型从“看图回答问题”推进到“按要求编排图文作品”。它针对现有系统在长文本连贯性、图文交错布局、参考图控制和语言能力保持之间难以兼顾的痛点,提供了一个参数高效的适配思路。7B规模也降低了部署门槛,为教育内容、报告生成、视觉叙事和交互式设计提供了开源基础。

技术贡献

技术核心是PLoRA,而非对全部序列统一施加LoRA。模型将图像表示作为特殊图像令牌接入语言模型,并让附加低秩更新集中作用于这些位置,使视觉能力获得定向调整,同时保护文本令牌对应的既有语言分布。该机制为多模态指令微调提供了更细粒度的参数隔离,并服务于自由格式图文生成。

新颖性

多数视觉语言工作重点是分类、问答或单向图像描述;InternLM-XComposer2强调输入和输出均可交错,且支持提纲、规格与参考图共同控制。PLoRA的创新在于按令牌类型分配适配能力,直接回应视觉学习可能损害语言生成质量的问题。

局限性

  • 摘要没有给出数据集名称、完整分数、训练规模、推理成本或统计显著性,因此无法独立核验“超过GPT-4V和Gemini Pro”的幅度与稳定性。
  • 自由式图文排版、长文事实性和复杂参考图一致性仍可能受训练数据、视觉编码器及生成长度限制;论文摘要未系统报告失败案例。

未来方向

后续可公开完整基准表、训练配方和消融实验,分析PLoRA秩、插入层与图像令牌数量的影响;还应加强事实核查、版面约束、长上下文记忆、版权与安全评估,并在更大规模模型及真实用户任务上验证泛化能力。

AI 总览摘要

视觉语言模型过去主要回答“图中有什么”,却不一定能把文字、图片和版式组织成一篇完整作品。InternLM-XComposer2将目标扩展为自由式图文组合:用户可以提供提纲、详细规格或参考图像,模型据此生成交错排列的长文本与视觉内容。该方向的难点在于,视觉适配可能削弱原有语言能力,而只依赖语言模型又难以准确理解图像。

模型建立在InternLM2-7B之上,并提出Partial LoRA(PLoRA)。传统LoRA通常对序列中的全部令牌进行低秩适配;PLoRA则把额外参数限制在图像令牌上,使模型重点学习视觉信息,同时尽量保留预训练语言知识、文风和长文本组织能力。由此,系统能够在视觉问答等理解任务之外,处理更开放的图文创作任务。

论文称,InternLM-XComposer2在多项视觉语言基准上显著超过已有多模态模型,并在部分评测中匹配或超过GPT-4V与Gemini Pro;但提供的摘要没有列出具体数据集、分数或提升百分比,因此这些结论需要结合完整实验表进一步核验。其公开的7B模型为报告撰写、教育课件、视觉叙事和内容设计提供了可部署基础。未来仍需检验事实性、复杂排版、版权安全和跨领域泛化。

深度分析

研究背景

视觉语言模型已从图像分类、图像描述发展到视觉问答和多模态对话。代表性系统通常擅长理解单张图像,却较少支持由提纲、规格和参考图共同驱动的长篇图文编排。InternLM-XComposer2关注这一空白,并以InternLM2-7B为语言基础,追求理解与创作统一。

核心问题

核心问题是视觉能力、语言能力和自由版式生成之间的冲突。全模型微调或统一LoRA可能改变语言模型原有分布,导致文风、连贯性和知识表达下降;仅增加视觉连接又可能不足以学习精细图像语义和复杂图文关系。

核心创新

第一,提出PLoRA,仅对图像令牌施加额外低秩参数。第二,将视觉输入转化为可与文本交错的图像令牌,支持图文混合上下文。第三,把任务从传统视觉问答扩展至由提纲、详细规格和参考图控制的自由式内容创作。摘要强调其兼顾视觉精度与文学表达。

方法详解

  • �� 输入:接收文本提纲、详细指令、图像或多种组合。
  • �� 视觉接入:将图像编码为图像令牌,并插入语言序列,使语言模型能统一处理文字和视觉上下文。
  • �� 参数适配:采用LoRA形式的低秩更新,但PLoRA只在图像令牌位置启用附加参数。
  • �� 生成:依托InternLM2-7B的自回归能力生成长文本,并组织交错图文内容。
  • �� 评估:同时考察自由式多模态创作和多项视觉语言理解基准。

实验设计

实验围绕两类能力展开:长文本多模态内容生成,以及视觉语言理解。比较对象包括现有多模态模型,并据摘要所述与GPT-4V、Gemini Pro进行对照。论文摘要没有提供具体数据集、评价指标、样本量、训练超参数或PLoRA消融表,因此这里只能准确复述总体结论,不能补写未公布数值。

结果分析

作者报告InternLM-XComposer2在长文本图文生成方面表现突出,并在多项视觉语言基准上显著优于现有模型。部分测试中其表现达到或超过GPT-4V和Gemini Pro。PLoRA被认为帮助保留语言知识与写作能力,但摘要没有给出逐数据集分数、提升百分比或统计误差。

应用场景

模型可用于自动制作图文报告、教学材料、产品说明、视觉故事和社交媒体内容。用户可通过提纲、规格或参考图控制结果。实际部署仍需配备图像处理、版式渲染、事实核查和版权过滤模块。

局限与展望

当前可见材料缺乏完整实验细节,难以判断不同基准上的优势幅度、成本和可复现性。模型可能在长文事实一致性、复杂版式、细粒度参考图遵循和跨领域知识上失败。后续应公开训练数据与消融结果,加入安全、版权、偏见和真实用户评测。

通俗解读 非专业人士也能看懂

可以把模型想成一位会写文章、也会做杂志排版的编辑。你给它一个主题提纲、几条详细要求,再放入一张参考图片,它不只是说出图片里有什么,还会把文字和图片安排成一篇完整内容。

难点在于,这位编辑原本已经很会写作。如果让他重新学习图片,可能把原来的语言功底弄乱。PLoRA像是一套只在“看图工作台”上使用的新工具:编辑在处理图片时获得额外帮助,但写文章的基本能力尽量不被改动。

因此,模型可以一边理解图片,一边保持较好的长文表达。它适合制作报告、课程材料或视觉故事。不过,像真正的编辑一样,它仍可能误读图片、写出不准确的事实,或排出不理想的版面。论文摘要还没有公布完整分数,所以我们应把“超过某些系统”的结论理解为作者报告,而不是可由摘要独立复核的数字。

简单解释 像给14岁少年讲一样

想象你在做一份超级酷的学校杂志:你给AI一个主题、几条规则,再发一张参考图片。普通聊天机器人可能只会描述图片,或者写一篇没有图片的文章;InternLM-XComposer2想做得更像真正的编辑,把文字和图片穿插起来,做成完整的图文作品。

它的大脑来自InternLM2-7B。问题是,AI学会看图片时,可能把原来很强的写作能力弄差。PLoRA就像给它增加一个“看图专用插件”,插件主要在处理图像信息时工作,不大幅修改它原来的文字能力。

论文说,它在多项视觉语言测试中超过不少已有模型,某些测试还达到或超过GPT-4V和Gemini Pro。不过,摘要没有告诉我们每项考试的具体分数,所以不能知道领先多少。它还能根据提纲、详细要求和参考图制作长篇图文内容。

这很适合做课件、海报说明、故事书或产品介绍。但它不是绝对正确的魔法机器:可能看错细节、编出事实,或者把版面安排得不够好。下一步需要更多公开数据、真实用户测试和安全检查。

术语表

Vision-Language Model (视觉语言模型)

同时处理图像与文字的模型。它可以理解视觉内容,也可以依据视觉和语言条件生成文字或多模态结果。

InternLM-XComposer2用其完成视觉理解与自由式图文创作。

Partial LoRA(部分低秩适配)

LoRA的局部版本,只在指定令牌或路径上加入低秩参数更新。它旨在减少对原模型其他能力的干扰。

本文将额外LoRA参数限制在图像令牌上。

Image Tokens(图像令牌)

表示图像内容、可插入语言序列的模型内部单元。它们让语言模型能够在文本上下文中处理视觉信息。

PLoRA专门作用于这些令牌。

InternLM2-7B

InternLM系列的约70亿参数语言模型。它为XComposer2提供语言生成、知识表达和长文本能力。

论文称XComposer2基于该模型构建。

Interleaved Text-Image Composition(交错式图文组合)

在同一输出中交替组织文字与图片,而不是只生成文本或单张图片。它强调内容结构和跨模态连贯性。

这是XComposer2的核心目标之一。

开放问题 这项研究留下的未解疑问

  • 1 摘要未提供具体数据集、逐项分数和提升百分比,因此无法判断模型相对GPT-4V、Gemini Pro的优势是否稳定、显著且可复现。
  • 2 仍需研究PLoRA在不同秩、层位置和图像令牌长度下的行为,以及它对长文事实性、复杂版式和跨领域泛化的影响。

应用场景

近期应用

图文报告与课件生成

教师、研究人员或企业可输入提纲、数据说明和参考图,生成初版图文报告或课程材料。上线前应结合模板渲染、事实核查和人工审核。

视觉内容策划

营销和媒体团队可用它把产品规格、品牌语气和示例图片整合成故事化文案。实际使用需要版权审查、品牌一致性检查和图像来源记录。

远期愿景

可交互的多模态创作助手

未来模型可根据用户连续修改自动重排文字、图片和版式,服务出版、教育和设计工作流。关键障碍包括事实可靠性、可控布局、版权治理和推理成本。

原文摘要

We introduce InternLM-XComposer2, a cutting-edge vision-language model excelling in free-form text-image composition and comprehension. This model goes beyond conventional vision-language understanding, adeptly crafting interleaved text-image content from diverse inputs like outlines, detailed textual specifications, and reference images, enabling highly customizable content creation. InternLM-XComposer2 proposes a Partial LoRA (PLoRA) approach that applies additional LoRA parameters exclusively to image tokens to preserve the integrity of pre-trained language knowledge, striking a balance between precise vision understanding and text composition with literary talent. Experimental results demonstrate the superiority of InternLM-XComposer2 based on InternLM2-7B in producing high-quality long-text multi-modal content and its exceptional vision-language understanding performance across various benchmarks, where it not only significantly outperforms existing multimodal models but also matches or even surpasses GPT-4V and Gemini Pro in certain assessments. This highlights its remarkable proficiency in the realm of multimodal understanding. The InternLM-XComposer2 model series with 7B parameters are publicly available at https://github.com/InternLM/InternLM-XComposer.

cs.CV cs.CL