研究提出统一ViT压缩框架用于田间病害检测
论文AI 评分 65/100arXiv cs.AI
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
针对资源受限的农业环境,研究人员提出了一种统一的视觉Transformer压缩框架。该框架结合了基于二阶灵敏度估计的Hessian平衡自适应块剪枝、量化以及基于注意力的知识蒸馏。在辣椒病害数据集上,集成压缩管线将模型大小从327.42 MB缩减至6.01 MB,缩减倍数为54.5倍,同时保持了95.13%的精度,与FP32基线持平。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载农业场景下的模型压缩需求
辣椒作为印度重要的经济作物,常受病害威胁,而田间识别需要专家介入。视觉Transformer虽然分类精度高,但计算开销大,难以部署在资源受限的农业设备上。现有的压缩方法通常单独处理剪枝、量化或知识蒸馏,缺乏对三者组合应用潜力的探索。为此,研究团队提出了一种统一的压缩框架,旨在解决实际农业约束下的模型部署问题。
统一压缩框架的技术构成
该框架集成了三种核心技术:Hessian平衡自适应块剪枝(H-BAC)、量化以及基于注意力的知识蒸馏。H-BAC利用二阶灵敏度估计来指导剪枝过程。研究通过受控消融实验,分别评估了每种技术在压缩族内的最佳配置,随后将表现最佳的组件整合到一个顺序部署管线中。这种系统化的组合方式旨在最大化压缩效益并保持模型性能。
实验结果与性能对比
在一个包含3类辣椒病害的村庄分割数据集上,研究进行了跨村庄、跨设备的分布外测试。结果显示,压缩后的模型在四种配置下均达到或超过了95.13%的FP32基线精度。完全集成的压缩管线实现了54.5倍的大小缩减,从327.42 MB降至6.01 MB。对比实验还发现,一个不经剪枝或蒸馏直接训练的同等大小学生模型,也能达到94.87%的相近精度。
为什么值得看
实现了大幅度的模型瘦身且精度不降,解决了边缘设备部署难题。
蒸馏量化数据集
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
