IMUG-Bench: Benchmarking Unified Multimodal Models on Interleaved Understanding and Generation

TL;DR

IMUG-Bench评估UMMs在多轮图文对话中的理解和生成能力,揭示生成侧的曝光偏差。

cs.AI 🔴 高级 2026-06-08 9 次浏览
Lingyi Meng Zecong Tang Haoran Li Tengju Ru Zhejun Cui Weitong Lian Qi Kang Hangshuo Cao Yichen Zhu Yechi Liu Kaixuan Wang Yu-Jie Yuan Chunwei Wang Yu Zhang Bo Dai
多模态模型 图文对话 生成能力 理解能力 曝光偏差

核心发现

方法论

IMUG-Bench通过多轮交互评估UMMs的理解和生成能力,涵盖静态空间、时间因果和混合类任务。采用LLM和VLM填充模板生成样本,并通过两人验证确保质量。

关键结果

  • 实验揭示UMMs在长上下文、多轮生成中存在明显曝光偏差,生成质量随对话轮次下降。
  • 测试时扩展策略如Chain-of-Thought提高生成准确性,减轻曝光偏差。
  • 主流开源和闭源UMMs在多轮交互中仍有显著改进空间。

研究意义

IMUG-Bench填补了现有基准在多轮图文对话评估中的空白,推动UMMs在实际应用中的发展。为未来模型的鲁棒性和多轮交互能力提升提供了方向。

技术贡献

提出了新的多轮交互评估框架,揭示了UMMs在生成任务中的曝光偏差,并验证了多种测试时扩展策略的有效性。

新颖性

IMUG-Bench首次系统评估UMMs在多轮图文对话中的理解和生成能力,提供了更真实的交互场景。

局限性

  • 在多轮生成任务中,UMMs的生成质量随轮次下降,存在明显的曝光偏差。
  • 现有模型在长上下文生成任务中仍有显著改进空间。

未来方向

未来研究可探索更多测试时扩展策略,进一步提升UMMs的多轮交互能力和生成质量。

AI 总览摘要

近年来,多模态模型在理解和生成任务上取得了显著进展,但现有基准未能有效评估多轮图文对话中的动态交互能力。IMUG-Bench通过多轮交互评估UMMs的理解和生成能力,涵盖静态空间、时间因果和混合类任务。实验揭示UMMs在长上下文、多轮生成中存在明显曝光偏差,生成质量随对话轮次下降。测试时扩展策略如Chain-of-Thought提高生成准确性,减轻曝光偏差。IMUG-Bench填补了现有基准在多轮图文对话评估中的空白,推动UMMs在实际应用中的发展。未来研究可探索更多测试时扩展策略,进一步提升UMMs的多轮交互能力和生成质量。

深度分析

研究背景

多模态学习模型在理解和生成任务上取得了显著进展,尤其是从大语言模型到多模态大语言模型的转变。尽管如此,现有的生成模型和理解模型仍沿着独立路径发展,统一整合面临挑战。

核心问题

现有基准未能有效评估多轮图文对话中的动态交互能力,通常局限于单轮或静态设置,忽视了多轮交互中的曝光偏差。

核心创新

IMUG-Bench通过多轮交互评估UMMs的理解和生成能力,涵盖静态空间、时间因果和混合类任务。采用LLM和VLM填充模板生成样本,并通过两人验证确保质量。

方法详解

  • �� 设计问题模板,涵盖静态空间、时间因果和混合类任务。
  • �� 使用LLM和VLM填充模板生成样本。
  • �� 通过两人验证确保样本质量。
  • �� 采用多种测试时扩展策略提高生成准确性。

实验设计

实验系统评估主流开源和闭源UMMs,揭示其在长上下文、多轮生成任务中的曝光偏差。采用Chain-of-Thought等测试时扩展策略提高生成准确性。

结果分析

实验揭示UMMs在长上下文、多轮生成中存在明显曝光偏差,生成质量随对话轮次下降。测试时扩展策略如Chain-of-Thought提高生成准确性,减轻曝光偏差。

应用场景

IMUG-Bench可用于评估UMMs在多轮图文对话中的理解和生成能力,推动其在实际应用中的发展。

局限与展望

现有模型在长上下文生成任务中仍有显著改进空间,生成质量随轮次下降,存在明显的曝光偏差。

通俗解读 非专业人士也能看懂

想象你在一个多模态对话中,像是在和朋友聊天。你们可以通过文字和图片交流,朋友能够理解你说的话并根据你的要求生成图片。IMUG-Bench就像一个测试,看看你的朋友在多轮对话中能否保持高质量的交流和图片生成。

简单解释 像给14岁少年讲一样

想象你在和朋友聊天,朋友不仅能理解你说的话,还能根据你的要求画出图片。IMUG-Bench就是一个测试,看看朋友在多轮对话中能否保持高质量的交流和图片生成。它就像是一个超级聊天机器人,能在复杂的对话中帮你画出你想要的东西。

术语表

UMM (统一多模态模型)

支持理解和生成的模型框架,结合多种模态进行交互。

用于评估多轮图文对话中的理解和生成能力。

曝光偏差

生成质量随对话轮次下降的问题。

在多轮生成任务中显著影响生成质量。

Chain-of-Thought

一种提高生成准确性的测试时扩展策略。

用于减轻多轮生成任务中的曝光偏差。

VLM (视觉语言模型)

结合视觉和语言信息进行任务处理的模型。

用于填充IMUG-Bench中的问题模板。

LLM (大语言模型)

处理语言信息的大规模模型。

用于填充IMUG-Bench中的问题模板。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步减轻多轮生成任务中的曝光偏差?
  • 2 现有模型在长上下文生成任务中如何改进?

应用场景

近期应用

多轮对话评估

用于评估UMMs在多轮图文对话中的理解和生成能力。

远期愿景

多模态交互发展

推动UMMs在实际应用中的发展,提高多轮交互能力。

原文摘要

In recent years, unified multimodal models (UMMs) have emerged to support both understanding and generation within a single framework. Mastering dynamic, multi-turn interleaved image-text dialogues is a crucial task for UMMs in real-world applications. However, existing benchmarks fail to evaluate this important task, as they are often limited to single-turn or static settings, and typically overlook exposure bias in multi-turn interactions. To bridge this gap, we propose IMUG-Bench, a comprehensive benchmark for multi-turn interleaved image-text dialogue of UMMs that jointly evaluates their understanding and generation capabilities. Our IMUG-Bench comprises three classes: Static Spatial, Temporal Causal, and Hybrid, covering 3,113 samples and 12,034 interaction turns. It also includes dynamic understanding questions, thereby supporting evaluation that better reflects real-world multi-turn interaction scenarios. Large-scale experiments on IMUG-Bench systematically evaluate mainstream open-source and closed-source UMMs, revealing their capability boundaries and failure modes, and uncovering pronounced exposure bias on the generation side in multi-turn interactions. We further explore several test-time scaling strategies, including Chain-of-Thought, Self-Verification, and Best-of-N Sampling, which effectively improve generation accuracy and mitigate exposure bias in generation tasks. These findings provide insights into enhancing the robustness and multi-turn interaction capability of future UMMs.

cs.AI cs.CV cs.MM