面向制造业的AI质量控制系统:完整的边缘AI部署指南

摘要

在生产车间部署人工智能质量控制比训练模型更为复杂——它需要定制数据集、精心挑选的硬件以及强大的边缘基础设施。Digi International的ConnectCore 95 SOM配合Digi ConnectCore 云服务,为机器视觉检测提供了一个完整的平台:从NPU加速推理和容器化模型打包,到空中升级、远程监控,以及一个持续改进循环,该循环可确保模型在实际环境条件变化时仍保持准确性。

制造商正面临着加快发现缺陷、减少浪费,并在不增加人手的情况下保持生产线正常运转的压力。面向制造业的人工智能质量控制软件已成为应对这一压力的最切实可行的解决方案。然而,要让该软件在生产车间可靠运行,其难度远超大多数团队的预期。

真正的挑战并不在于构建一个能够检测缺陷的模型。在受控环境下,大多数团队都能做到这一点。真正的挑战在于将该模型部署到边缘端的嵌入式硬件上,在生产条件发生变化的情况下保持其准确性,并在没有数据科学家驻守每个地点的情况下,对分布在多个设施中的设备群进行管理。

Digi International 最近举办了一场题为“弥合边缘 AI 差距:从模型训练到实际部署”的网络研讨会,对这一问题进行了端到端的探讨。本次研讨会由RBZ Robot Design 联合举办,通过展示在西班牙瓦伦西亚一家面包店中运行的自动化视觉检测系统,演示了从数据采集到现场 OTA 模型更新的整个部署过程。本文将揭示其中的关键经验,并将其应用于工业质量控制部署。

主要收获:

  • 要达到制造质量控制所需的95%以上的准确率门槛,必须基于实际生产环境构建定制数据集,而非使用通用的开源图像。
  • 您选择的训练框架应根据计划用于推理的加速器来决定。在项目进行中更换框架代价高昂。
  • 量化可将模型大小缩减约4倍,并显著加快推理速度,但会导致5%至10%的精度损失。量化感知训练是应对这一问题的最有效方法。
  • 推理性能因硬件层级而异,差异巨大。Digi ConnectCore 95 上的内部 NPU 其推理速度约为 CPU 的 27 倍,而外部 RBZ ARA240 加速器则将推理时间缩短至 2 毫秒以内。
  • 容器化使边缘AI部署具备可移植性、版本管理能力和可更新性,且无需触及上层的应用层。
  • Digi ConnectCore 云服务提供 OTA 模型更新、远程监控以及一个可从单台设备扩展至数千台设备的持续改进循环。
  • Digi ConnectCore 95 在设计时已内置升级路径。从内部 NPU 切换到外部加速器只需更新容器,无需更换硬件。

1. 数据采集与标注

大多数项目往往低估了这一步所需的投入。虽然基于开源图像数据集训练出的模型准确率可达75%至80%,但制造业的质量控制通常要求准确率达到95%或更高。要达到这一门槛,就必须构建一个能够真实反映实际生产环境的定制数据集:包括贵公司的产品、照明条件以及缺陷类型。

面包房项目耗时数月才收集到可用的数据。该工厂会根据需求,在不同日子生产不同种类面包,因此数据集必须涵盖广泛的产品和生产条件。这需要现场连续数周的视频录制,随后与能够准确识别缺陷具体表现的面包房员工合作,进行帧提取和人工标注。

实践经验是:数据收集应比感觉上必要的更早开始,团队应从第一天起就做好规划,以应对现场设备出现新边际情况时数据集随之演变的情况。

2. 培训框架的选择

应根据模型最终的运行环境来选择用于训练的框架。如果目标加速器需要 TensorFlow Lite,那么从一开始就在 TensorFlow 中进行训练,可以避免后期繁琐的转换工作。对于支持 ONNX 或 PyTorch 的加速器,则有其他选择。

对于面包房检测系统,RBZ Robot Design 选择了 PyTorch 和 ONNX,因为它们既能针对 CPU,也能针对外部 ARA240 加速器。此外,还构建了一个独立的 TensorFlow 模型,用于针对Digi ConnectCore 95 的内部 NPU 进行验证。框架的选择影响了后续的每一步工作,如果在项目中途更改框架,将会付出高昂的代价。

3. 云端模型训练

基于 GPU 的云端训练通常会生成一个浮点模型。对于大多数 AI 团队而言,这一步是整个流程中最熟悉的部分,但有一个环节却经常被忽略,那就是检查点注册。每次训练运行(包括其超参数和结果)都应被记录并存储。当模型在部署六个月后开始在实际应用中出现漂移时,能够将问题追溯到特定的训练状态就显得尤为重要。

4. 边缘推理的模型优化

这一步是区分边缘AI与云AI的关键。在嵌入式NPU上运行的模型必须从32位浮点数量化为8位整数表示。其收益显著:模型大小可缩减约4倍,内存带宽要求降低,且推理速度更快。但量化会导致5%至10%的精度损失,有时甚至更多。

应对这种损失最有效的方法是“量化感知训练”,该方法通过调整训练过程本身,以应对推理阶段将出现的精度降低问题。对于恩智浦(NXP)的i.MX 95和Digi ConnectCore 95平台,恩智浦的eIQ软件框架提供了完整的工具链:涵盖量化、精度恢复以及跨所有三个计算层级的推理部署。

在面包房项目中,有一条架构原则被证明是正确的:较小的模型比较大的模型具有更清晰的量化效果。将一项复杂任务拆分为两个更轻量级的模型(例如,一个用于定位,一个用于分类),对于在边缘设备上进行优化而言,往往比构建一个同时处理这两项任务的单一模型更为容易。

5. 容器包装

模型优化完成后,会与其推理运行时、依赖项和配置一起打包到容器中。容器化现已成为生产级边缘AI的标准做法。容器具有可移植性、版本控制和可重现性。它还将应用层与推理层解耦:如果目标加速器从内部NPU切换为ARA240,只需更换容器即可完成过渡,而无需修改其上方的应用程序。

Digi ConnectCore 云服务支持LXC、Docker 和 Podman 容器格式。打包后的容器会被推送至云端仓库,在那里它将成为用于在现场设备群中进行部署、监控和更新的构建产物。

获取数据表
了解Digi ConnectCore 95 SMARC系统级模块(SOM)