Rethinking Fine-Tuning: Unlocking Hidden Capabilities in Vision-Language Models

TL;DR

MFT方法在视觉语言模型中无需更新权重即可超越LoRA,提升性能。

cs.LG 🔴 高级 2025-12-29 14 次浏览
Mingyuan Zhang Yue Bai Yifan Wang Yiyang Huang Yun Fu
视觉语言模型 微调 MFT LoRA 结构重参数化

核心发现

方法论

本文提出了一种基于掩码微调(MFT)的结构重参数化方法,应用于视觉语言模型(VLMs)的语言和投影组件。MFT通过为每个权重分配可学习的门控分数,重组模型的内部子网络以适应下游任务,而无需更新冻结的预训练权重。

关键结果

  • MFT在Qwen2.5-0.5B模型上,S-MFT Both变体在所有任务中表现最佳,超越了FFT和LoRA方法,尤其在MME任务中达到了1349.3的性能。
  • 在多种VLM架构上,MFT的表现甚至超过了完全微调,同时保持了预训练模型的冻结状态。
  • 实验表明,MFT在多个基准测试中显著优于强PEFT基线,包括LoRA的多个变体。

研究意义

该研究揭示了无需更新权重即可实现有效适应的可能性,挑战了传统微调方法对权重更新的依赖。通过利用模型中已有的知识结构,MFT在不增加计算资源的情况下提高了性能,这对学术界和工业界都有重要意义。

技术贡献

技术贡献包括提出了一种新的微调范式,通过结构重参数化而非权重更新来实现模型适应,提供了新的理论保证和工程可能性。MFT展示了冻结权重的模型中潜在的适应能力,改变了现有的微调方法。

新颖性

MFT是首个在视觉语言模型中应用掩码微调的研究,突破了传统PEFT方法的局限,通过结构重参数化实现了更高效的模型适应。

局限性

  • MFT在某些特定任务中可能表现不如完全微调,尤其在需要大规模权重更新的场景中。
  • 对掩码生成策略的选择可能影响最终性能。

未来方向

未来工作可以探索MFT在更大规模模型上的应用,以及如何优化掩码生成策略以进一步提升性能。

AI 总览摘要

近年来,视觉语言模型(VLMs)在多模态任务中取得了显著进展。然而,传统的完全微调方法在面对大规模模型时,计算和存储成本过高。本文提出了一种新的微调方法,掩码微调(MFT),通过为每个权重分配可学习的门控分数,重组模型的内部子网络以适应下游任务,而无需更新冻结的预训练权重。

实验结果表明,MFT在多个基准测试中显著优于强PEFT基线,包括LoRA的多个变体。特别是在Qwen2.5-0.5B模型上,S-MFT Both变体在所有任务中表现最佳,尤其在MME任务中达到了1349.3的性能。

MFT的成功揭示了无需更新权重即可实现有效适应的可能性,挑战了传统微调方法对权重更新的依赖。未来的研究可以探索MFT在更大规模模型上的应用,以及如何优化掩码生成策略以进一步提升性能。

深度分析

研究背景

视觉语言模型(VLMs)通过大规模多模态数据训练,在视觉问答、图像描述等任务中表现出色。然而,随着模型规模的扩大,完全微调(FFT)的计算和存储成本变得难以承受,促使研究者探索参数高效微调(PEFT)方法,如LoRA。

核心问题

传统微调方法依赖于显式的权重更新,忽视了预训练模型中已编码的丰富表示结构。如何在不更新权重的情况下,充分利用这些结构以适应下游任务,是一个亟待解决的问题。

核心创新

本文提出的掩码微调(MFT)方法,通过为每个权重分配可学习的门控分数,重组模型的内部子网络以适应下游任务。与传统的权重更新方法不同,MFT无需改变冻结的预训练权重。

方法详解

  • �� 引入可学习的门控分数矩阵,与预训练权重矩阵同尺寸。
  • �� 通过掩码生成策略,生成二值或连续掩码。
  • �� 使用掩码调整有效权重,实现模型的结构重参数化。
  • �� 采用直通估计器(STE)进行梯度计算。

实验设计

实验在多个VLM架构上进行,包括Qwen2.5-0.5B、TinyLLaMA-1.1B等,评估了MFT在不同任务上的性能。基准测试包括GQA、MMMU、POPE等,比较了MFT与FFT和LoRA的表现。

结果分析

MFT在所有测试中表现优异,尤其在Qwen2.5-0.5B模型上的MME任务中达到了1349.3的性能。与FFT和LoRA相比,MFT在多个任务中实现了更高的准确率和更快的收敛速度。

应用场景

MFT可用于需要高效适应的多模态任务,如视觉问答、图像描述等。其无需更新权重的特性,使其在计算资源有限的场景中具有优势。

局限与展望

MFT在某些特定任务中可能表现不如完全微调,尤其在需要大规模权重更新的场景中。此外,对掩码生成策略的选择可能影响最终性能。

通俗解读 非专业人士也能看懂

想象一个工厂,里面有许多机器,每台机器都有不同的开关组合来完成特定任务。传统的方法是通过改变机器的内部结构来适应新任务,而MFT则是通过调整开关的组合来实现同样的效果。这样,工厂无需拆卸和重组机器,只需调整开关即可适应新的生产需求。

简单解释 像给14岁少年讲一样

嘿,小伙伴们!想象一下你在玩一个超级复杂的拼图游戏。通常,你需要不断调整每块拼图来完成图案。但MFT就像是给你一个魔法工具,可以直接改变拼图的连接方式,而不需要移动每一块。这让你更快地完成游戏,还能节省很多力气!是不是很酷?

术语表

掩码微调 (Mask Fine-Tuning)

一种通过为每个权重分配可学习的门控分数来重组模型内部结构的微调方法。

用于在不更新权重的情况下适应下游任务。

低秩适应 (Low-Rank Adaptation)

一种通过注入可训练的低秩矩阵来更新模型权重的微调方法。

作为PEFT的主流方法之一,与MFT进行比较。

直通估计器 (Straight-Through Estimator)

一种用于处理非可微操作的梯度估计方法。

用于MFT中掩码生成的梯度计算。

冻结权重 (Frozen Weights)

在训练过程中保持不变的预训练模型权重。

MFT通过冻结权重实现高效适应。

结构重参数化 (Structural Reparameterization)

通过调整模型内部结构而非权重更新来实现适应的技术。

MFT的核心创新之一。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模的模型上优化MFT的掩码生成策略,以进一步提升性能。
  • 2 在某些特定任务中,MFT的表现不如完全微调,如何改进这一点。

应用场景

近期应用

视觉问答

MFT可用于视觉问答任务,通过调整模型结构而非权重更新来提高性能,适用于计算资源有限的场景。

图像描述

在图像描述任务中,MFT通过掩码微调实现高效适应,减少计算和存储成本。

远期愿景

大规模多模态模型

MFT的成功可能推动大规模多模态模型的高效适应,减少对计算资源的依赖。

原文摘要

Explorations in fine-tuning Vision-Language Models (VLMs), such as Low-Rank Adaptation (LoRA) from Parameter Efficient Fine-Tuning (PEFT), have made impressive progress. However, most approaches rely on explicit weight updates, overlooking the extensive representational structures already encoded in pre-trained models that remain underutilized. Recent works have demonstrated that Mask Fine-Tuning (MFT) can be a powerful and efficient post-training paradigm for language models. Instead of updating weights, MFT assigns learnable gating scores to each weight, allowing the model to reorganize its internal subnetworks for downstream task adaptation. In this paper, we rethink fine-tuning for VLMs from a structural reparameterization perspective grounded in MFT. We apply MFT to the language and projector components of VLMs with different language backbones and compare against strong PEFT baselines. Experiments show that MFT consistently surpasses LoRA variants and even full fine-tuning, achieving high performance without altering the frozen backbone. Our findings reveal that effective adaptation can emerge not only from updating weights but also from reestablishing connections among the model's existing knowledge. Code available at: https://github.com/Ming-K9/MFT-VLM

cs.LG cs.CV