Lightweight Vision Transformer Compression for On-Device Plant Disease Detection in Resource-Constrained Agricultural Field Conditions

TL;DR

提出H-BAC框架,结合量化和知识蒸馏,实现95.13%准确率和54.5倍模型压缩。

cs.CV 🔴 高级 2026-09-05 99 次浏览
Mahadev Sunil Kumar Bhavika Gondi Desaisetty Venkata Satya Sai Swapnith Gangireddy Rahul Jogi Sudheesh Manalil Arnab Raha Amitava Mukherjee Parthasarathy Seethapathy G. Gopakumar
视觉变换器 模型压缩 边缘AI 植物病害检测 知识蒸馏

核心发现

方法论

本文提出了一种轻量级视觉变换器压缩框架,结合了Hessian平衡自适应块剪枝(H-BAC)、量化和基于注意力的知识蒸馏。每种技术首先通过控制消融研究独立评估,然后将表现最佳的组件整合到一个顺序部署管道中,以适应现实农业约束。

关键结果

  • 在辣椒三类村庄分割数据集上,压缩模型达到或超过95.13%的FP32基线准确率,同时实现了74-98%的模型尺寸缩减。
  • 完整集成压缩管道实现了54.5倍的尺寸缩减,从327.42MB减少到6.01MB,准确率为95.13±2.32%。
  • 直接训练的学生模型在相同的6.01MB INT8尺寸下达到94.87%的准确率,表明H-BAC和知识蒸馏的计算成本是否值得。

研究意义

该研究在学术界和工业界具有重要意义,解决了在资源受限设备上部署视觉变换器的长期难题。通过结合多种压缩技术,提供了一种高效的解决方案,适合在农业领域进行植物病害检测,尤其是在印度农村地区。

技术贡献

技术贡献包括提出了H-BAC剪枝方法,结合了Hutchinson估算的块级Hessian曲率和基于一阶Taylor的组件剪枝。还引入了基于注意力的知识蒸馏方案,解决了特征维度不匹配问题。

新颖性

这是首次在农业病害检测中评估联合压缩管道,H-BAC通过二阶Hessian曲率分配非均匀剪枝率,区别于传统方法。

局限性

  • H-BAC和知识蒸馏的计算成本可能在某些情况下不值得,尤其是在直接训练学生模型时。
  • 剪枝和量化可能导致模型在某些设备上的性能下降。
  • 数据集的多样性可能不足以涵盖所有可能的农业场景。

未来方向

未来研究方向包括进一步优化压缩算法以提高效率,探索更多农业应用场景,以及开发更具鲁棒性的模型以应对不同的环境条件。

AI 总览摘要

辣椒是印度经济上重要的作物,但其生产力受到难以识别的病害威胁。虽然视觉变换器在分类准确性上表现优异,但其计算量大,难以在资源受限设备上部署。现有的压缩方法通常单独处理剪枝、量化和知识蒸馏,未充分探索其联合应用的潜在好处。本文提出了一种统一的视觉变换器压缩框架,结合了Hessian平衡自适应块剪枝(H-BAC)、量化和基于注意力的知识蒸馏。通过控制消融研究独立评估每种技术,随后将表现最佳的组件整合到一个顺序部署管道中,以适应现实农业约束。在辣椒三类村庄分割数据集上,压缩模型达到或超过95.13%的FP32基线准确率,同时实现了74-98%的模型尺寸缩减。完整集成压缩管道实现了54.5倍的尺寸缩减,从327.42MB减少到6.01MB,准确率为95.13±2.32%。直接训练的学生模型在相同的6.01MB INT8尺寸下达到94.87%的准确率,表明H-BAC和知识蒸馏的计算成本是否值得。该研究在学术界和工业界具有重要意义,解决了在资源受限设备上部署视觉变换器的长期难题。通过结合多种压缩技术,提供了一种高效的解决方案,适合在农业领域进行植物病害检测,尤其是在印度农村地区。

深度分析

研究背景

近年来,自动化植物病害检测技术取得了显著进展。早期的方法依赖于传统机器学习和手工特征,如颜色直方图和纹理描述符。然而,这些方法在实际田间条件下的泛化能力有限。卷积神经网络(CNN)的出现改变了这一局面,CNN在PlantVillage数据集上实现了95%的分类准确率。视觉变换器(ViTs)进一步推动了性能的提升,成为植物病害分类的最新技术。然而,ViTs的计算成本高,难以在低端移动设备上部署。

核心问题

辣椒是印度重要的经济作物,但其生产力受到病害威胁。传统的诊断方法依赖专家检查或实验室检测,成本高且速度慢,难以在印度农村大规模应用。需要一种自动化系统,能够在田间直接检测和识别植物病害,尤其是在早期阶段。

核心创新

本文提出了一种轻量级视觉变换器压缩框架,结合了Hessian平衡自适应块剪枝(H-BAC)、量化和基于注意力的知识蒸馏。H-BAC通过二阶Hessian曲率分配非均匀剪枝率,区别于传统方法。基于注意力的知识蒸馏方案解决了特征维度不匹配问题。

方法详解

  • �� 使用H-BAC进行剪枝,通过Hessian曲率分配剪枝率。
  • �� 应用量化技术,将模型转换为INT8格式。
  • �� 使用基于注意力的知识蒸馏,转移教师模型的注意力图。
  • �� 进行消融研究,评估每种技术的独立效果。
  • �� 整合最佳组件,形成顺序部署管道。

实验设计

实验使用辣椒三类村庄分割数据集,进行跨村庄和跨设备测试。基线模型为ViT-B/16,预训练于ImageNet-1K。评估指标包括准确率、精确率、召回率和F1分数。消融研究用于评估每种压缩技术的独立效果。

结果分析

压缩模型在辣椒数据集上达到或超过95.13%的FP32基线准确率,实现了74-98%的模型尺寸缩减。完整集成压缩管道实现了54.5倍的尺寸缩减,从327.42MB减少到6.01MB,准确率为95.13±2.32%。

应用场景

该技术可用于资源受限设备上的植物病害检测,尤其适合印度农村地区。需要具备一定的计算能力和摄像头设备。对农业生产效率和病害管理具有重要影响。

局限与展望

虽然压缩技术有效,但在某些设备上的性能可能下降。数据集的多样性可能不足以涵盖所有可能的农业场景。未来需要进一步优化算法以提高效率。

通俗解读 非专业人士也能看懂

想象一个工厂,工厂里有很多机器在生产产品。每台机器都很重要,但有些机器可能不需要一直开着。我们的研究就像是给工厂做了一次大扫除,把那些不常用的机器关掉,这样工厂就能更高效地运作。我们还给工厂的工人提供了新的工具,让他们能更快地完成工作。这就像是我们对视觉变换器模型进行压缩和优化的过程。通过这种方式,工厂不仅能节省资源,还能提高生产效率。这就是我们研究的核心思想。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,游戏里有很多关卡和任务。每次你升级的时候,你都会得到一些新的技能和装备,让你能更快地过关。我们的研究就像是给游戏角色做了一次升级,让它能在更少的时间里完成更多的任务。我们还给角色提供了一些新的工具,让它能更好地应对游戏中的挑战。这样一来,游戏不仅变得更有趣,还能让你更快地获得胜利。这就是我们研究的目的。

术语表

视觉变换器 (Vision Transformer)

一种基于注意力机制的深度学习模型,能够同时处理图像的多个区域。

用于植物病害分类,具有高准确率。

模型压缩 (Model Compression)

减少模型尺寸和计算量的方法,包括剪枝、量化和知识蒸馏。

用于在资源受限设备上部署视觉变换器。

知识蒸馏 (Knowledge Distillation)

一种将大模型的知识转移到小模型的方法,通常通过软标签实现。

用于提高压缩模型的性能。

剪枝 (Pruning)

通过移除不重要的参数来减少模型复杂度的方法。

在H-BAC中用于减少视觉变换器的计算量。

量化 (Quantization)

将模型参数转换为低精度格式以减少计算量的方法。

用于将模型转换为INT8格式。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化压缩算法以提高效率和性能?
  • 2 在不同环境条件下,模型的鲁棒性如何提高?
  • 3 如何扩展数据集以涵盖更多农业场景?

应用场景

近期应用

农业病害检测

可用于实时检测和识别植物病害,帮助农民提高生产效率。

资源受限设备部署

适用于低端移动设备,提供高效的病害检测解决方案。

远期愿景

智能农业管理

通过自动化病害检测提高农业生产效率,推动农业技术进步。

原文摘要

Chilli (Capsicum annuum) is one of India's most economically significant crops, yet its productivity is persistently threatened by diseases that are difficult to identify without expert intervention. While Vision Transformers (ViTs) have achieved high classification accuracy, their large computational footprint makes deployment on resource constrained devices challenging. Existing compression approaches typically address pruning, quantization, and knowledge distillation in isolation, leaving the potential benefits and interactions of their combined application insufficiently explored. We propose a unified Vision Transformer compression framework that combines Hessian-Balanced Adaptive Block Pruning (H-BAC), guided by second-order sensitivity estimation, with quantization and attention-based knowledge distillation. To systematically identify the most effective configuration within each compression family, each technique is first evaluated independently through controlled ablation studies, after which the best-performing components are integrated into a sequential deployment pipeline tailored to real-world agricultural constraints. On a chilli 3-class village-split dataset with a genuine cross-village, cross-device out-of-distribution test split, the resulting compressed models match or exceed the 95.13% FP32 baseline's accuracy, alongside 74-98% model size reduction, and the fully integrated compression pipeline achieves a 54.5x size reduction (327.42 MB to 6.01 MB) at 95.13 +/- 2.32% accuracy across four tested configurations. A direct comparison further reveals that, on this dataset, a directly-trained student of the same final size, without pruning or distillation, reaches comparable accuracy of 94.87%, at the same 6.01 MB INT8 size, indicating where H-BAC and knowledge distillation are, and are not yet shown to be, worth their computational cost.

cs.CV cs.AI cs.LG