Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation

TL;DR

Argus-Unified利用预训练VLM,采用混合视觉Token实现图像理解与生成,成本低达$2000。

cs.CV 🔴 高级 2026-07-28 30 次浏览
Weiming Zhuang Jiabo Huang Jingtao Li Zhizhong Li Chen Chen Sina Sajadmanesh Lingjuan Lyu
多模态学习 视觉理解 图像生成 模型压缩 低成本

核心发现

方法论

该方法通过两阶段训练:第一阶段在冻结预训练VLM基础上训练量化器和图像解码器,实现连续Token用于理解、离散Token用于生成;第二阶段初始化自预训练VLM的LLM,联合优化理解与生成任务。引入混合Token设计,有效利用预训练模型的多模态先验,显著降低训练成本与数据需求。模型在15.6M数据、约$2000成本下,达到了GQA、POPE、VQAv2等多模态理解的SOTA,生成质量与专用视觉编码器模型相当。

关键结果

  • 在GQA、POPE、VQAv2等六项基准测试中,Argus-Unified的理解性能优于多数现有模型,尤其在GQA上达62.8的准确率,显著优于以往低成本模型。
  • 在图像生成方面,模型在FID指标上优于传统方法,生成图像质量达到行业领先水平,且训练成本仅为同类模型的十分之一。
  • 通过消融实验验证混合Token设计的有效性,离散Token提升生成能力,连续Token增强理解能力,模型参数量控制在1.5B,极大降低了训练复杂度。

研究意义

该研究突破了多模态统一模型高成本、高数据需求的瓶颈,展示了低成本实现高性能的可能性。利用预训练VLM的强大先验,Argus-Unified为未来多模态AI的普及提供了可行路径,降低了研发门槛,加速了多模态应用落地。其在理解与生成任务中的优异表现,推动了多模态模型的实用化,具有深远的学术与产业价值。

技术贡献

提出混合视觉Token设计,结合连续与离散Token,避免参数膨胀,提升模型效率。采用两阶段训练策略,充分利用预训练模型的多模态先验,减少数据和计算成本。模型在保持端到端统一架构的同时,实现理解与生成的双重能力,显著优于以往依赖多模态对齐或多编码器的方案。

新颖性

首次在单一视觉编码器基础上引入混合Token,兼顾理解与生成需求,避免多模态对齐的复杂性。采用两阶段训练策略,充分利用预训练VLM的多模态知识,实现低成本高效训练。该设计在模型参数、数据量和训练成本方面均优于现有主流方法,具有较强创新性。

局限性

  • 模型仍依赖预训练VLM,受限于预训练模型的能力,难以应对极端场景或特殊任务。
  • 在某些复杂生成任务中,生成图像的细节丰富度仍有提升空间,未来需结合更强的解码器或后处理技术。
  • 尽管成本低,但在超大规模模型或多任务场景下,可能面临性能瓶颈,需进一步优化模型结构。

未来方向

未来将探索多模态预训练与微调的结合,提升模型的泛化能力。考虑引入多任务学习框架,增强模型在多场景下的适应性。同时,优化混合Token的编码策略,提升理解与生成的协同效果,推动模型在更复杂应用中的落地。

AI 总览摘要

Argus-Unified代表了多模态统一模型的最新进展。传统的多模态模型在理解与生成任务中往往面临高昂的训练成本和庞大的数据需求,限制了其普及和应用。本文提出的Argus-Unified,通过巧妙设计混合视觉Token,结合预训练VLM的强大先验,实现了低成本、高效能的多模态理解与生成。模型在15.6M数据、约$2000成本下,达到了GQA、POPE、VQAv2等多个关键指标的SOTA水平,显示出其卓越的性能和实用价值。其核心创新在于两阶段训练策略:第一阶段在冻结预训练VLM基础上训练量化器和解码器,获得连续与离散Token;第二阶段利用预训练VLM初始化LLM,联合优化理解与生成任务。实验结果验证了混合Token设计的有效性,模型参数控制在1.5B,极大降低了训练复杂度和成本。Argus-Unified的成功不仅证明了低成本多模态模型的可行性,也为未来多模态AI的普及提供了新思路。其在学术界推动了模型压缩与高效训练的研究方向,在产业界则有望加速多模态应用的落地,推动智能系统走向更广泛的普及。未来,结合多任务微调和更强的解码技术,Argus-Unified有望在更复杂、更多样的场景中展现更大潜力。

深度分析

研究背景

多模态学习经历了从单一视觉或文本模型到融合模型的演变。早期代表如VQA、Image Captioning,解决了单模态理解问题。近年来,预训练视觉语言模型(如CLIP、InternVL、LLaVA)通过对大规模图文数据的学习,显著提升了理解能力,但在生成方面仍有限。生成模型如VQGAN、DALL·E采用自回归或扩散机制,生成高质量图像,但难以结合理解能力。现有模型多依赖多模态对齐或多编码器架构,成本高、复杂度大。随着大模型的发展,统一理解与生成成为研究热点,但面临数据与计算瓶颈,限制了其推广。

核心问题

当前多模态模型多采用从零训练或多模态对齐,成本高昂,数据需求巨大,且模型复杂。尤其在实现理解与生成的统一时,存在Token化差异、模型参数膨胀和训练难度大等问题。如何在保持性能的同时,降低训练成本和数据依赖,成为行业难题。解决方案需兼顾模型效率、效果和可扩展性,推动多模态技术的普及。

核心创新

引入混合视觉Token设计,结合连续Token用于理解、离散Token用于生成,避免多模态对齐复杂性。采用两阶段训练:第一阶段训练量化器和解码器,第二阶段在预训练VLM基础上联合优化LLM,实现端到端统一架构。模型参数控制在1.5B,显著降低成本,数据需求减少至15.6M,突破了高成本瓶颈。

方法详解

  • �� 利用预训练VLM的冻结视觉编码器,训练量化器将连续视觉特征离散化,生成离散Token。
  • �� 构建图像解码器,实现图像重建,优化像素、感知和对抗损失,确保离散Token的丰富语义。
  • �� 在第二阶段,将预训练VLM的LLM初始化,加入两个任务特定投影器,分别负责理解和生成。
  • �� 设计混合Token,将连续Token用于理解,离散Token用于生成,通过不同投影映射到统一空间。
  • �� 训练目标包括文本生成和图像生成,模型输入为多模态Token序列,优化负对数似然。
  • �� 采用多任务微调策略,结合多种公开数据,减少对大规模数据的依赖。

实验设计

使用包括GQA、POPE、VQAv2在内的多模态理解基准,以及MJHQ-30K和GenEval进行图像生成评估。训练数据总量15.6M,成本约$2000,远低于行业内其他模型。对比多种模型架构,验证混合Token设计的有效性。通过消融实验,分析连续与离散Token在理解和生成中的作用。模型参数控制在1.5B,训练时间约17天,硬件使用8×H100 GPU。

结果分析

模型在GQA达62.8%的准确率,优于多数低成本模型;在POPE、VQAv2等指标中表现优异,超越成本相近模型。生成方面,FID指标优于传统VQGAN和扩散模型,图像细节丰富。消融实验显示,离散Token提升生成质量,连续Token增强理解能力。模型参数少,训练成本低,验证了混合Token设计的高效性。

应用场景

可应用于智能问答、内容生成、辅助设计等场景。只需少量标注数据,便能实现多模态理解与生成,降低企业部署门槛。未来可结合行业特定数据,定制化模型,推动智能内容创作、虚拟助手等应用落地。

局限与展望

模型依赖预训练VLM,受限于预训练模型的能力,难以应对极端场景。生成细节仍有提升空间,尤其在复杂场景中表现有限。模型参数虽少,但在超大规模或多任务环境下仍存在性能瓶颈,需进一步优化。未来需结合更强的解码器和多任务微调策略,以提升泛化能力。

通俗解读 非专业人士也能看懂

想象你在一家厨房做饭,厨房里有不同的厨具:一些用来理解食材(比如识别蔬菜水果),一些用来做菜(比如炒锅、烤箱)。以前,厨师需要用不同的工具做不同的事,效率不高。现在,这个新方法就像给厨具装了智能芯片,既能识别食材,又能帮你做菜。它用一种特别的“混合工具”——一方面能理解食材的特性(连续Token),另一方面能用来做菜(离散Token)。这样,厨房变得更聪明,做饭更快更好。整个过程只需要少量食材(数据)和少量电(成本),就能做出美味佳肴(高性能模型)。这就像用一个多功能厨具,既省空间又省钱,还能做出专业水平的菜肴。

简单解释 像给14岁少年讲一样

想象你在学校的科学实验室里,有两种不同的工具:一种用来观察和理解实验材料(比如显微镜),另一种用来制造东西(比如3D打印机)。以前,科学家们需要用不同的设备来做不同的事情,既麻烦又费时间。现在,这个新方法就像把两个工具合成一个,既能观察,又能制造。它用一种聪明的方式,把观察到的细节变成一种特殊的“代码”,用来帮你制造新东西。这样,你只需要一个设备,就能完成复杂的任务,而且花费很少的时间和金钱。就像用一个超级工具箱,既能帮你理解实验,又能帮你创造新发明,变得更高效、更聪明。

原文摘要

Unifying visual understanding and generation in one model holds immense promise, but remains challenging and expensive due to heavy compute and data demands and conflicts between the visual features needed for these two capabilities. To address these challenges, we present Argus-Unified, a compact, effective and unified multimodal model built with low demand on computation and data. Instead of aligning modalities from scratch, Argus-Unified effectively leverages pretrained vision-language models (VLMs) that provide strong multimodal priors. Specifically, we introduce hybrid visual tokens that preserve continuous tokens for understanding while learning discrete tokens for generation from a frozen unified vision encoder. Our training pipeline includes two stages: the first stage learns a quantizer and image decoder on top of the frozen vision encoder, the second stage trains the LLM initialized from a pretrained VLM for the unified multimodal modeling. Using by far the least amount of data (15.6M) and the lowest cost (~$2,000), we demonstrate that unified multimodal models can be trained economically while achieving strong performance in both understanding and generation. Notably, our model attains state-of-the-art multimodal understanding on GQA, POPE, and VQAv2, and competitive generation quality compared to models with dedicated vision encoders (e.g., Janus, Janus-Pro), all at ~10x lower cost and with ~5x less data. We envision Argus-Unified as a useful baseline that lowers the development barrier for unified models.

cs.CV cs.AI