Self-Boosting Vision-Language Models with Noisy Student On-Policy Self-Distillation

TL;DR

提出NOPD(无噪声学生自我蒸馏),无需外部模型或真值,利用预测差异实现自我提升。

cs.LG 🔴 高级 2026-07-25 51 次浏览
Shuai Wang Daoan Zhang Zhe Tang Hao Cheng Jiaheng Wei
视觉-语言模型 自我蒸馏 噪声增强 自监督学习 视觉推理

核心发现

方法论

本文提出的NOPD基于模型在干净与腐蚀输入上的预测差异,利用模型自身预测作为监督信号。核心机制包括:• 采用模型对干净输入的预测作为目标,• 通过对图像应用噪声、降采样、伽马变换等多种腐蚀操作,• 训练模型在腐蚀输入上生成响应,并以干净输入预测作为自我监督。损失函数采用反向KL散度,确保模型在腐蚀与干净输入间保持一致。该方法无需外部教师或真值,依赖模型内部预测差异实现自我提升。

关键结果

  • 在五个视觉推理任务中,NOPD在Geometry3K数据集上仅用2100个样本训练,即提升Qwen2.5-VL-7B模型20分(验证集),超越传统的强化学习和外部蒸馏方法。
  • 在MathVista测试集上获得7.4分的提升,显示出良好的泛化能力。多模型、多任务验证表明,NOPD在12个基准上均有显著性能提升,且无需外部监督。
  • 通过不同腐蚀类型(噪声、降采样、伽马变换)验证,腐蚀操作显著增强模型鲁棒性和推理效率,减少输出长度同时提升准确率。

研究意义

该研究突破了传统依赖外部数据或模型的限制,提出纯自我蒸馏策略,有效提升视觉-语言模型的性能。其无需额外标注或教师模型,极大降低了训练成本,为模型自我优化提供新思路。此方法不仅在推理任务中表现优异,还具备良好的泛化能力,有望推动自主学习和自我改进的研究发展,具有重要的理论与实践意义。

技术贡献

本文创新性在于引入模型内部预测差异作为自监督信号,结合腐蚀输入实现自我蒸馏。提出的反向KL散度损失和腐蚀策略,增强模型鲁棒性与泛化能力。该方法打破了传统外部教师依赖的局限,为视觉-语言模型的自我提升提供了新机制,兼具低成本和高效率。实验验证其在多任务、多模型上的优越表现,彰显其广泛适用性。

新颖性

首次提出基于预测差异的自我蒸馏方法,利用腐蚀输入生成密集监督信号,无需外部模型或真值。区别于传统的知识蒸馏和强化学习,强调模型内部的对比学习机制,创新性地实现模型自我提升。该方法在视觉推理任务中展现出优异性能,推动了自我监督与自我改进的研究方向。

局限性

  • 当前方法依赖腐蚀操作的选择与参数调优,可能在某些复杂场景下效果有限,且对腐蚀类型敏感。
  • 模型在极端噪声或复杂场景下的鲁棒性仍需验证,且训练过程中的超参数调节较为繁琐。
  • 未来需探索多模态融合的更深层次自我监督机制,以及在更大规模数据集上的扩展能力。

未来方向

未来将结合多模态数据增强技术,提升模型在复杂环境中的鲁棒性。探索多任务学习与自我蒸馏的结合,进一步降低对腐蚀策略的敏感性。此外,计划扩展到更大规模的多模态数据集,实现更广泛的自主学习能力,推动视觉-语言模型的自我优化边界。

AI 总览摘要

近年来,视觉-语言模型(VLMs)在多项任务中取得了突破性进展,但其优化仍高度依赖外部监督信息,如人类标注、外部教师模型或强化学习奖励。这些依赖限制了模型的自主改进能力,增加了训练成本。本文提出的NOPD(无噪声学生自我蒸馏)方法,突破了这一瓶颈。通过在模型内部引入预测差异作为自监督信号,利用腐蚀输入(噪声、降采样、伽马变换)生成腐蚀样本,模型在腐蚀样本上生成响应,并以干净输入的预测作为目标,实现自我提升。该机制无需外部模型或真值,极大降低了训练依赖,且在五个视觉推理任务中表现优异。在Geometry3K数据集上,使用仅2100样本训练,模型提升20分,超越传统强化学习和外部蒸馏方法。实验还显示,该方法具有良好的泛化能力,能在不同模型和任务中实现性能提升。腐蚀操作不仅增强模型鲁棒性,还实现推理压缩,提高效率。整体来看,NOPD为视觉-语言模型的自主学习提供了新思路,具有广泛应用前景。未来,将结合多模态数据和更大规模数据集,推动模型自我优化的边界,开启自主学习新时代。

深度分析

研究背景

视觉-语言模型(VLMs)近年来在多模态理解任务中取得显著进展,典型代表包括CLIP、ALIGN等。传统训练依赖大量标注数据,后续通过微调、知识蒸馏和强化学习等方式提升性能。然而,这些方法普遍依赖外部教师或真值,成本高且难以实现模型的自主优化。近年来,自我蒸馏和自我学习成为研究热点,尝试用模型自身生成的响应进行训练,但多依赖外部反馈或复杂机制,限制了其普适性和效率。

核心问题

核心问题在于如何在没有外部监督的情况下,提升模型的推理能力和泛化能力。现有方法多依赖外部教师、标注或奖励信号,难以实现完全自主的模型优化。尤其在多模态场景中,缺乏有效的自我监督机制,限制了模型的持续改进。如何利用模型内部信息,设计低成本、高效的自我提升策略,是当前亟待解决的难题。

核心创新

本文提出的创新点主要包括:• 利用模型在干净与腐蚀输入上的预测差异,作为密集的自监督信号,突破了外部监督的限制;• 引入腐蚀操作(噪声、降采样、伽马变换)增强模型鲁棒性,提升泛化能力;• 采用反向KL散度作为损失函数,确保模型在腐蚀与干净输入间保持一致。这些创新结合,形成了无需外部模型或真值的自我蒸馏机制,显著降低训练成本。

方法详解

  • �� 输入:训练集中的图像x和文本查询q。• 图像腐蚀:应用噪声、降采样、伽马变换等多种操作,生成腐蚀样本T(x)。• 模型响应:在腐蚀样本和干净样本上分别生成响应,分别为πθ(y|q,T(x))和πθ(y|q,x)。• 损失计算:采用反向KL散度(DKL)作为目标,最小化腐蚀样本响应与干净样本响应的差异,确保模型在不同输入下保持一致。• 训练流程:在每次迭代中,模型在腐蚀输入上采样响应,并以干净输入的预测作为目标,更新模型参数。• 关键技术:停止梯度传播到干净输入响应,避免模型崩溃,保持训练稳定。

实验设计

  • �� 数据集:Geometry3K、MathVista、MathVision等。• 模型:Qwen2.5-VL-7B、Qwen3.5-2B等。• 训练:仅用少量样本(如2100个)进行微调。• 评估:在多项视觉推理和问答任务中,比较不同方法(SFT、KD、RLVR、OPD、NOPD)。• 超参数:腐蚀类型(噪声、降采样、伽马变换)、损失函数(反向KL)、生成长度等。• 进行消融实验验证不同设计选择的影响。

结果分析

  • �� NOPD在Geometry3K上提升20分,超越强化学习和外部蒸馏,且只用2100样本。• 在MathVista上获得7.4分提升,显示良好泛化。• 多模型多任务验证,12个基准均有显著提升。• 腐蚀操作增强模型鲁棒性,减少输出长度,提高推理效率。• 实验还验证不同腐蚀类型对性能的贡献,噪声效果最佳。

应用场景

  • �� 适用于需要自主学习的视觉-语言应用,如机器人交互、自动问答系统。• 低成本训练,适合资源有限的场景。• 长远来看,可推动模型在无监督环境中的持续自我优化,减少对人工标注的依赖。

局限与展望

  • �� 依赖腐蚀策略的选择,可能在某些复杂场景下效果有限。• 在极端噪声或复杂环境中鲁棒性待验证。• 训练过程超参数调节较繁琐,未来需简化与自动化。

通俗解读 非专业人士也能看懂

想象一个学生在学校学习,老师布置作业,但学生没有老师的答案,也没有参考书。学生自己试着做题,但发现题目难,容易出错。于是,他开始观察自己做错的地方,尝试用不同的方法解决问题。每次做完题,他会记住自己哪里出错了,然后下一次就会改正。这个学生其实在用自己以前的答案作为“老师”,不断练习和改进。这个过程就像论文中的方法,模型用自己在干净和腐蚀输入上的预测差异,作为“老师”帮助自己变得更聪明。通过不断尝试和修正,模型变得更强大,不依赖外部答案,也不需要老师的指导,就能自己学习和提升。

简单解释 像给14岁少年讲一样

想象你在玩一款游戏,但没有攻略,也没有朋友告诉你怎么过关。你自己反复试错,发现每次出错的地方,然后自己总结经验。比如,你发现跳跃的时机不对,就调整一下,慢慢变得更厉害。这就像论文里的方法,模型用自己在不同“环境”下的表现差异,自己当“老师”不断改进。每次遇到困难,它都试着用不同的方法,观察结果,然后自己变得更聪明。这种自己学习、不断改进的方式,不但省去了找老师的麻烦,还能让自己变得越来越厉害。就像你在游戏中变成了高手一样,模型也变得更强大、更聪明了。

原文摘要

Post-training enables vision-language models (VLMs) to understand human instructions and perform various downstream tasks. Current post-training methods usually rely on human-annotated data, distillation from external models, reinforcement learning with human feedback, or verifiable answers. This limits their ability to improve without external supervision. To tackle this, we propose NOPD (Noisy Student On-Policy Self-Distillation), a simple yet effective self-distillation approach that improves VLMs without any external models or ground-truth answers. Our key insight is that prediction discrepancies between clean and corrupted inputs naturally induce a self-supervision signal. In NOPD, the model learns from corrupted inputs while using its own predictions under clean inputs as token-level supervision. We show the effectiveness of NOPD on five visual reasoning tasks; it can match and even outperform reinforcement learning approaches or distillation from external models. Notably, when trained with 2.1K samples from Geometry3K, NOPD improves Qwen2.5-VL-7B by 20 points on its validation set. It also shows generalization on out-of-distribution test sets and achieves 7.4 point gains on MathVista. Furthermore, we demonstrate that NOPD is a general approach to enhance VLMs, achieving improvements across three models on 12 benchmarks.

cs.LG