AdaDINO: Context-Adaptive DINO-Distilled Vision Foundation Models for Efficient Open-Vocabulary Edge Inference

TL;DR

AdaDINO通过任务自适应架构搜索提升边缘设备视觉模型效率,准确率提升7.9%,FLOPs降低74.9%。

cs.CV 🔴 高级 2026-04-17 36 次浏览
Yiwei Zhao Yi Zheng Huapeng Su Jieyu Lin Stefano Ambrogio Cijo Jose Michael Ramamonjisoa Patrick Labatut Barbara De Salvo Chiao Liu Phillip B. Gibbons Ziyun Li
视觉基础模型 神经架构搜索 边缘计算 开放词汇 模型压缩

核心发现

方法论

本文提出基于DINOv2的视觉基础模型,结合神经架构搜索(NAS)实现子网的任务级自适应选择。利用云端多模态大语言模型(LLM)进行场景理解,过滤候选类别集,并通过学习的选择器在不同子网间动态切换。训练包括三阶段:超网蒸馏、视觉文本对齐和子网选择器训练,采用沙盒采样确保模型兼容性。运行时,系统根据场景复杂度选择最优子网,显著降低计算成本。

关键结果

  • 在IN1K数据集上,AdaDINO在保持相同精度的情况下,平均FLOPs降低了74.9%,在acc@1提升7.9%。在ADE20K的开词汇分割任务中,mIoU提升5.2%。实验显示,任务自适应子网选择比固定模型节省37%的平均计算量。
  • 在零样本分类和开放词汇分割中,AdaDINO优于同规模模型,展现出优越的准确率-效率平衡,尤其在边缘设备上表现出极佳的实用性。
  • 消融实验表明,模型蒸馏、场景理解和子网选择三者协同贡献了性能提升,特别是在复杂场景下的模型压缩效果尤为显著。

研究意义

该研究突破了边缘设备视觉模型的效率瓶颈,结合任务场景动态调整模型容量,有效解决模型过大带来的计算压力,推动边缘智能的实际落地。其创新的自适应架构搜索和场景理解机制,为未来多模态边缘AI提供了新思路,具有广泛的工业应用潜力。

技术贡献

提出结合神经架构搜索(NAS)与蒸馏技术的多子网架构,支持在不同任务复杂度下动态切换,显著提升模型效率。引入云端多模态大语言模型进行场景理解,结合学习的子网选择器,实现端边协同优化。该方法兼容多种基础模型,提供理论保证和工程实现路径,推动边缘AI模型的可扩展性与适应性。

新颖性

首次将NAS与DINO蒸馏模型结合,设计任务场景自适应子网选择机制,突破传统固定模型的局限。不同于现有模型压缩方法,AdaDINO动态调节模型容量,兼顾精度与效率,特别适用于边缘端复杂多变的场景。

局限性

  • 系统依赖云端多模态大模型的场景理解,可能在网络不稳定或云端不可用时表现不佳。
  • 子网选择器的训练依赖大量场景标注,泛化能力在极端场景下仍需验证。
  • 模型蒸馏和NAS训练成本较高,部署复杂度增加,未来需优化训练流程以降低成本。

未来方向

未来将探索更高效的场景理解模型,减少云端依赖;优化子网搜索策略以适应更复杂的任务;结合联邦学习实现多设备协同自适应,提升系统的鲁棒性与扩展性。

AI 总览摘要

随着边缘设备对智能感知的需求不断增长,如何在有限的计算资源下实现高效、准确的视觉理解成为关键挑战。传统大规模视觉基础模型(VFM)虽具备优异性能,但在边缘环境中难以部署,主要受限于计算能力和能耗。为此,本文提出AdaDINO,一种结合神经架构搜索(NAS)与蒸馏技术的任务自适应模型框架。

AdaDINO的核心思想是根据场景和任务复杂度动态选择不同容量的子网,从而在保证精度的同时大幅降低计算成本。系统利用云端多模态大语言模型(LLM)进行场景理解,筛选出相关类别集,并通过学习的子网选择器在多个预定义子网中选择最优方案。训练流程包括三阶段:超网蒸馏、视觉文本对齐和子网选择器训练,确保模型在多任务环境下的兼容性和鲁棒性。

在实际部署中,AdaDINO在IN1K和ADE20K数据集上均表现优异。其在保持相似或更高精度的基础上,将FLOPs平均降低了74.9%,在图像分类任务中提升了7.9%的准确率。在开词汇分割任务中,mIoU提升了5.2%。这些结果充分验证了任务场景自适应策略的有效性。系统的优势在于结合云端理解与端侧推理,实现端云协同优化,极大提升了边缘AI的实用性和能效。

未来,AdaDINO可扩展到更复杂的多模态任务,结合更高效的场景理解模型,降低云端依赖,推动边缘智能的广泛应用。其创新的模型架构和训练策略,为边缘设备上的深度学习模型提供了新的设计范式,具有重要的学术价值和产业潜力。

深度分析

研究背景

近年来,视觉基础模型(VFM)如DINOv2、CLIP等在多任务学习中表现出色,推动了AI在图像识别、分割等领域的突破。尤其在大规模预训练后,模型具备良好的迁移能力,但其庞大的参数规模和计算需求限制了在边缘设备的部署。为解决这一问题,模型压缩、蒸馏和架构搜索成为研究热点。现有工作多关注模型剪枝、量化或静态压缩,缺乏对任务复杂度的动态适应能力。随着多模态AI的发展,场景理解成为提升模型效率的重要方向。行业中,边缘设备如智能眼镜、无人机等对低延时、低能耗的视觉模型需求日益增长,但现有模型难以满足实时性和能效的双重要求。

核心问题

边缘设备在运行大规模视觉模型时面临计算资源有限、能耗高和延时要求严格的挑战。传统模型在保证高精度的同时,计算成本巨大,难以实现持续、实时的视觉感知。如何在保证任务精度的前提下,动态调整模型容量,减少不必要的计算,成为亟待解决的问题。此外,场景变化多样,单一模型难以适应不同复杂度的任务,导致资源浪费和性能下降。

核心创新

本研究提出结合神经架构搜索(NAS)与蒸馏技术,设计多子网结构支持任务场景自适应。创新点包括:• 任务场景理解:利用云端多模态大语言模型(LLM)进行场景语义理解,筛选相关类别集;• 子网动态切换:训练支持多容量子网的超网,通过学习的选择器在推理时根据场景复杂度选择最优子网;• 端云协同:端侧持续运行视觉编码器,云端提供场景理解和类别过滤,减少端侧计算负担。这一方案突破了传统静态模型的局限,实现了模型容量的动态调节,极大提升了效率。

方法详解

  • �� 训练阶段:采用超网蒸馏(OFA-NAS)将DINOv2蒸馏到ConvNeXt超网,确保模型兼容性;• 视觉文本对齐:冻结主干,训练映射视觉特征到文本空间,采用对比损失(Lcontrast);• 子网选择器训练:利用场景类别统计,回归子网的准确率保留比例,采用树模型预测不同子网的性能,优化模型选择;• 运行时:云端多模态LLM每隔几分钟推断场景,生成类别集和场景标签,端侧连续运行视觉编码器,实时计算视觉与文本的相似度,选择最优子网进行推理。

实验设计

在IN1K、Food101、DTD和Pets等数据集上验证,采用FLOPs、参数量和实际延时作为指标。对比静态模型和动态自适应模型,验证不同子网在不同场景下的性能。通过消融实验确认蒸馏、场景理解和子网选择器的贡献。测试在ARM Ethos-U55硬件上,测量实际能耗和延时,确保方案的实用性。模型在保持高精度的同时,显著降低了计算成本,验证了方法的有效性。

结果分析

实验结果显示,AdaDINO在IN1K上,FLOPs平均降低74.9%,准确率提升7.9%;在ADE20K的开词汇分割任务中,mIoU提升5.2%。子网自适应策略比固定模型节省37%的平均计算,且在多任务场景中表现出优越的准确率-效率平衡。消融分析表明,模型蒸馏、场景理解和子网选择器的协同作用是性能提升的关键。系统在边缘设备上的实际部署验证了其高效性和鲁棒性。

应用场景

该方法适用于智能监控、自动驾驶、增强现实等场景,能在有限硬件资源下实现高效视觉感知。通过端云协同,降低能耗和延时,提升用户体验。未来可结合更复杂的多模态任务,推动边缘AI的智能化发展,满足工业自动化、智慧城市等需求。

局限与展望

系统依赖云端场景理解,网络不稳定时性能受影响。子网选择器训练成本较高,泛化能力需进一步验证。模型蒸馏和NAS过程复杂,部署难度较大,未来需优化训练流程和模型结构以降低成本。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,厨房里有很多不同的厨具和食材。有时候你只需要用简单的锅和少量食材就能做出一道快餐,但有时候需要用复杂的厨具和大量食材做出大餐。为了节省时间和能源,你会根据菜的难度和时间选择不同的厨具和食材组合。AdaDINO就像这个厨房管理系统,它能根据场景(比如快餐或大餐)自动选择合适的厨具(模型子网),让你既能做出好菜,又不浪费能源。云端的智能厨师(大语言模型)会帮你判断场景,告诉你需要哪些食材和厨具,然后厨房里的机器人(端侧模型)根据指令快速工作。这种方式让厨房既高效又灵活,能应对各种不同的菜肴需求。

简单解释 像给14岁少年讲一样

想象你在学校的厨房里做饭,有时候你只需要用简单的锅和少量食材就能做出快餐,但有时候你需要用复杂的厨具和很多食材做大餐。为了节省时间和能源,你会根据菜的难度选择不同的厨具和食材。AdaDINO就像这个聪明的厨房助手,它可以根据你要做的菜(场景)自动选择合适的厨具(模型子网),让你既能做出好吃的饭,又不浪费能源。云端的智能厨师(大语言模型)会帮你判断场景,告诉你需要哪些食材和厨具,然后厨房里的机器人(端侧模型)根据指令快速工作。这让厨房变得又快又省力,能应付各种不同的菜肴需求。

原文摘要

Always-on contextual AI runs language-aligned vision foundation models (VFMs) on edge devices, where the on-device model is the dominant continuous compute cost under strict latency and power limits. Due to an observed low-frequency shift in scene context and its relevant vocabulary, we present AdaDINO, an adaptive framework that makes on-device VFM inference efficient by matching execution to the current scene and task. We build on a known phenomenon, that the accuracy drop of shrinking model sizes depends on the task, and turn it into task-level adaptive execution. AdaDINO integrates neural architecture search (NAS) into a language-aligned VFM backbone distilled from DINOv2, training a single family of subnets for efficient execution during runtime. A multimodal large language model (LLM) on the cloud, invoked at low frequency, refines the candidate class set from scene context, while a learned selector activates the least-cost subnet predicted to retain a target fraction of accuracy. With the backbone and semantic pipeline held fixed, learned selection alone reduces average compute by $37\%$ over the best fixed subnet at equal segmentation accuracy. Across zero-shot classification and open-vocabulary segmentation, AdaDINO establishes a strong accuracy-efficiency frontier, improving over evaluated models of comparable sizes by up to $7.9\%$ in acc@1 on IN1K and $5.2\%$ mIoU on ADE20K, and reducing average FLOPs by up to $74.9\%$ at similar accuracy.

cs.CV cs.LG