摘要
在生产车间部署人工智能质量控制比训练模型更为复杂——它需要定制数据集、精心挑选的硬件以及强大的边缘基础设施。Digi International的ConnectCore 95 SOM配合Digi ConnectCore 云服务,为机器视觉检测提供了一个完整的平台:从NPU加速推理和容器化模型打包,到空中升级、远程监控,以及一个持续改进循环,该循环可确保模型在实际环境条件变化时仍保持准确性。
制造商正面临着加快发现缺陷、减少浪费,并在不增加人手的情况下保持生产线正常运转的压力。面向制造业的人工智能质量控制软件已成为应对这一压力的最切实可行的解决方案。然而,要让该软件在生产车间可靠运行,其难度远超大多数团队的预期。
真正的挑战并不在于构建一个能够检测缺陷的模型。在受控环境下,大多数团队都能做到这一点。真正的挑战在于将该模型部署到边缘端的嵌入式硬件上,在生产条件发生变化的情况下保持其准确性,并在没有数据科学家驻守每个地点的情况下,对分布在多个设施中的设备群进行管理。
Digi International 最近举办了一场题为“弥合边缘 AI 差距:从模型训练到实际部署”的网络研讨会,对这一问题进行了端到端的探讨。本次研讨会由RBZ Robot Design 联合举办,通过展示在西班牙瓦伦西亚一家面包店中运行的自动化视觉检测系统,演示了从数据采集到现场 OTA 模型更新的整个部署过程。本文将揭示其中的关键经验,并将其应用于工业质量控制部署。
主要收获:
- 要达到制造质量控制所需的95%以上的准确率门槛,必须基于实际生产环境构建定制数据集,而非使用通用的开源图像。
- 您选择的训练框架应根据计划用于推理的加速器来决定。在项目进行中更换框架代价高昂。
- 量化可将模型大小缩减约4倍,并显著加快推理速度,但会导致5%至10%的精度损失。量化感知训练是应对这一问题的最有效方法。
- 推理性能因硬件层级而异,差异巨大。Digi ConnectCore 95 上的内部 NPU 其推理速度约为 CPU 的 27 倍,而外部 RBZ ARA240 加速器则将推理时间缩短至 2 毫秒以内。
- 容器化使边缘AI部署具备可移植性、版本管理能力和可更新性,且无需触及上层的应用层。
- Digi ConnectCore 云服务提供 OTA 模型更新、远程监控以及一个可从单台设备扩展至数千台设备的持续改进循环。
- Digi ConnectCore 95 在设计时已内置升级路径。从内部 NPU 切换到外部加速器只需更新容器,无需更换硬件。
制造业中的人工智能质量控制系统究竟需要什么
制造业中基于人工智能的质量控制依赖于机器视觉:摄像头对生产线进行监控,经过训练的模型则分析每一帧画面,对产品进行分类并标记缺陷。这听起来很简单。但在实际应用中,它需要硬件、软件和运营基础设施之间紧密协调的集成体系。
传统的自动化检测系统通常依赖基于PC的计算。这种方法虽然可行,但单价昂贵,且难以维护和扩展。嵌入式边缘AI改变了这种成本结构。推理在配备专用AI芯片的嵌入式设备上本地运行。该系统体积小巧,专为工业应用而设计。
Digi ConnectCore 95 SOM正是为这一具体应用场景而设计的。Digi ConnectCore 95 基于 NXP i.MX 95 处理器,提供了 OEM 厂商构建可投入生产的机器视觉检测系统所需的一切功能,包括高性能 Cortex-A55 核心、集成神经处理单元(NPU)、图像信号处理器(ISP),并支持多达八路摄像头输入。 此外,PCIe总线还支持连接外部神经网络加速器,以满足需要更高AI吞吐量的应用需求,正如采用RBZ ARA240模块的面包房检测部署所示。
完整的AI质量控制开发工作流
对于计划首次部署边缘AI的团队而言,了解完整的工作流程至关重要。以下步骤反映了RBZ Robot Design面包房项目中实际采用的流程。从宏观层面来看,这些步骤也适用于制造业中的其他AI质量控制系统部署。
1. 数据采集与标注
大多数项目往往低估了这一步所需的投入。虽然基于开源图像数据集训练出的模型准确率可达75%至80%,但制造业的质量控制通常要求准确率达到95%或更高。要达到这一门槛,就必须构建一个能够真实反映实际生产环境的定制数据集:包括贵公司的产品、照明条件以及缺陷类型。
面包房项目耗时数月才收集到可用的数据。该工厂会根据需求,在不同日子生产不同种类面包,因此数据集必须涵盖广泛的产品和生产条件。这需要现场连续数周的视频录制,随后与能够准确识别缺陷具体表现的面包房员工合作,进行帧提取和人工标注。
实践经验是:数据收集应比感觉上必要的更早开始,团队应从第一天起就做好规划,以应对现场设备出现新边际情况时数据集随之演变的情况。

2. 培训框架的选择
应根据模型最终的运行环境来选择用于训练的框架。如果目标加速器需要 TensorFlow Lite,那么从一开始就在 TensorFlow 中进行训练,可以避免后期繁琐的转换工作。对于支持 ONNX 或 PyTorch 的加速器,则有其他选择。
对于面包房检测系统,RBZ Robot Design 选择了 PyTorch 和 ONNX,因为它们既能针对 CPU,也能针对外部 ARA240 加速器。此外,还构建了一个独立的 TensorFlow 模型,用于针对Digi ConnectCore 95 的内部 NPU 进行验证。框架的选择影响了后续的每一步工作,如果在项目中途更改框架,将会付出高昂的代价。
3. 云端模型训练
基于 GPU 的云端训练通常会生成一个浮点模型。对于大多数 AI 团队而言,这一步是整个流程中最熟悉的部分,但有一个环节却经常被忽略,那就是检查点注册。每次训练运行(包括其超参数和结果)都应被记录并存储。当模型在部署六个月后开始在实际应用中出现漂移时,能够将问题追溯到特定的训练状态就显得尤为重要。
4. 边缘推理的模型优化
这一步是区分边缘AI与云AI的关键。在嵌入式NPU上运行的模型必须从32位浮点数量化为8位整数表示。其收益显著:模型大小可缩减约4倍,内存带宽要求降低,且推理速度更快。但量化会导致5%至10%的精度损失,有时甚至更多。
应对这种损失最有效的方法是“量化感知训练”,该方法通过调整训练过程本身,以应对推理阶段将出现的精度降低问题。对于恩智浦(NXP)的i.MX 95和Digi ConnectCore 95平台,恩智浦的eIQ软件框架提供了完整的工具链:涵盖量化、精度恢复以及跨所有三个计算层级的推理部署。
在面包房项目中,有一条架构原则被证明是正确的:较小的模型比较大的模型具有更清晰的量化效果。将一项复杂任务拆分为两个更轻量级的模型(例如,一个用于定位,一个用于分类),对于在边缘设备上进行优化而言,往往比构建一个同时处理这两项任务的单一模型更为容易。
5. 容器包装
模型优化完成后,会与其推理运行时、依赖项和配置一起打包到容器中。容器化现已成为生产级边缘AI的标准做法。容器具有可移植性、版本控制和可重现性。它还将应用层与推理层解耦:如果目标加速器从内部NPU切换为ARA240,只需更换容器即可完成过渡,而无需修改其上方的应用程序。
Digi ConnectCore 云服务支持LXC、Docker 和 Podman 容器格式。打包后的容器会被推送至云端仓库,在那里它将成为用于在现场设备群中进行部署、监控和更新的构建产物。
选择合适的推理硬件
面包店检查演示得出的一个重要发现是,不同推理解决方案的性能差异极为显著,且最佳选择取决于具体应用或使用场景。下图来自现场演示,三种配置均使用了相同的模型。
| 加速器 |
推理时间 |
最佳匹配 |
| CPU(NXP i.MX 95) |
1.6秒 |
原型制作;小型扳机模型 |
| 内置 NPU(NXP Neutron,2 TOPS) |
60毫秒 |
大多数工业检测应用 |
| 外部 NPU(RBZ ARA240,最高 16 TOPS) |
1.8 毫秒 |
高吞吐量、多模型或以增长为导向的部署 |
在开发过程中,CPU 是理想的起点。它迭代速度快,且无需特殊优化。Digi ConnectCore 95上的内置 NPU 性能比 CPU 提升了约 27 倍,这对于许多自动化质量检测用例而言已绰绰有余。 RBZ ARA240 通过 PCIe 接口提供高达 40 TOPS 的运算性能和 16 GB 专用内存,除视觉工作负载外,还能支持大型语言模型。对于致力于构建智能制造系统的团队而言,这一点值得重点考虑。
在烘焙演示中,三种配置的准确率均保持一致。无论是在 CPU、内部 NPU 还是 ARA240 上运行,量化方法都能保持一致的结果。应用层无法获知当前使用的是哪种加速器。
一种实用的部署路径:先部署采用内部NPU的初始设备,同时保留基于Digi ConnectCore 95的硬件上的ARA240插槽。当AI需求增长时(例如模型数量增加、模型规模扩大或吞吐量提升),部署外部加速器只需更新容器,而无需完全更换硬件。
利用Digi ConnectCore 云服务进行车队管理
部署一套单台机器视觉检测系统,通过手动流程即可完成。但若要在多个厂区部署五十套系统,且随着产品和缺陷的变化需要持续更新检测模型,则需要完善的运营基础设施。
Digi ConnectCore 云服务为生产级边缘人工智能部署提供了 MLOps 支撑架构。其主要功能包括以下内容。
空中(OTA)容器更新。新模型版本可推送至单个设备、设备组或整个设备群。分阶段部署使团队能够在向全量用户推广前,先在试点组中验证新模型。这同时满足了当前网络安全法规(包括《欧盟网络弹性法案》)中嵌入的OTA软件和安全更新要求。
远程监控与可观测性。每个已部署的Digi ConnectCore 95 SOM都会向云端仪表盘报告运行遥测数据:CPU负载、内存使用情况、网络I/O以及应用程序指标。在面包房演示中,仪表盘显示了每秒帧数、每台设备的推理时间、总扫描次数以及缺陷检测率,所有数据均可远程访问。无需技术人员现场维护。
持续改进循环。当模型在实际应用中开始出现漂移——准确率下降、出现新的缺陷类型、环境条件发生变化——时,可以配置设备将运行数据发送回云端。这些数据会反馈到训练管道中,系统会训练并打包一个新模型,然后将更新后的容器推送至设备群。无论设备群中只有一台设备还是数千台,该循环都能以完全相同的方式运行。
合规性模板。该仪表板包含一个模板功能,用于定义固件和机型的最低版本要求。设备上线时会检查该模板,若不符合要求,则会自动更新。此功能对于可能长时间处于离线状态的设备尤为有用,可确保所有设备均符合合规要求。
工业人工智能部署的安全性
工业质量控制环境要求,只有经过验证和签名的有效工作负载才能在生产硬件上运行。在控制或监控生产线的设备上运行未经授权的代码,是绝对不能接受的风险。
Digi TrustFence为Digi ConnectCore 95 提供基于硬件的安全防护,确保仅允许经过验证且已签名的负载运行。Digi ConnectCore 云服务已通过 SOC 2 Type 2 认证,所有设备与云端之间的通信均采用基于证书的身份验证和 TLS 加密。这些安全功能已包含在每块Digi ConnectCore 95 SOM 中,无需额外付费。
入门
以下是一些非常好的资源,可帮助您着手开展基于人工智能/机器学习的边缘人工智能项目:
关于边缘AI部署的常见问题
制造业中人工智能质量控制的最低精度阈值是多少?如何达到这一阈值?
大多数制造业质量控制应用都需要达到95%或更高的准确率。要达到这一水平,必须基于您的实际生产环境构建定制化数据集,而非使用通用开源图像数据集——后者的准确率通常最高仅为75%至80%。这意味着需要在现场收集数据,涵盖您的具体产品、照明条件和缺陷类型,并协同了解何为真实缺陷的员工对数据进行标注。
一个边缘AI检测项目通常需要多长时间来收集数据?
这比大多数团队预期的要耗时更久。本文所述的面包店部署项目耗时数月进行数据采集,其中包括数周的连续现场视频录制。由于该面包店在不同日子生产不同种类的面包,需要覆盖各种情况,因此时间表被进一步延长。团队应比感觉有必要的时间更早开始数据采集,并预留空间以应对数据集随时间推移而不断增长的情况——随着已部署设备发现新的边缘案例,数据集规模会随之扩大。
在针对边缘推理对模型进行优化时,准确率会下降多少?
将32位浮点数量化为8位整数(这是在嵌入式NPU上运行模型所必需的),通常会导致5%至10%的精度损失,有时甚至更多。 “量化感知训练”会预先调整训练过程以应对这种精度降低,是应对这一损失的最有效方法。面包店项目通过采用这种方法,在所有三种硬件配置(CPU、内部 NPU 和外部 NPU)上都保持了一致的准确率。
在Digi ConnectCore 95上,CPU、内置NPU和外置NPU在推理性能方面存在哪些差异?
两者之间的差异非常显著。在 CPU(NXP i.MX 95)上运行时,每次推理大约需要 1.6 秒,这虽然适合原型开发,但对于大多数生产检测线来说速度太慢。而内部 NPU(NXP Neutron,2 TOPS)将这一时间缩短至约 60 毫秒,性能提升了约 27 倍,足以满足大多数工业检测用例的需求。 外部 RBZ ARA240(最高 16 TOPS)将推理时间进一步缩短至约 1.8 毫秒,适用于高吞吐量或多模型部署。
如果初始部署后对人工智能的需求增加,我是否需要更换硬件?
不,Digi ConnectCore 95在设计时已内置了升级路径。首批设备可采用内置NPU出货,同时预留PCIe插槽以支持RBZ ARA240外部加速器。当需求增加时(例如需要添加更多模型、更大规模的模型或更高的吞吐量),部署外部加速器仅需更新容器,而无需更换硬件。
对于一个边缘AI项目,我应该使用什么样的训练框架?
应根据您计划在何种加速器上运行推理来选择框架。如果目标硬件要求使用 TensorFlow Lite,那么从一开始就在 TensorFlow 中进行训练,可以避免后期繁琐的转换工作。 在面包店项目中,RBZ Robot Design 选择了 PyTorch 和 ONNX,以同时支持 CPU 和 ARA240 加速器,并单独构建了一个 TensorFlow 模型,用于针对Digi ConnectCore 95 内部 NPU 进行验证。项目中途更换框架代价高昂,因此应尽早做出决定。
模型更新是如何推送至现场设备的?
Digi ConnectCore 云服务负责处理空中(OTA)容器更新。新模型版本可推送到单个设备、设备组或整个设备群。分阶段部署使团队能够在广泛部署前,先在试点组中验证新模型。此外,还可以通过合规性模板对设备进行配置,这些模板定义了固件和模型的最低版本要求;当设备联机后被检测到不符合合规性要求时,系统将自动触发更新。
在实践中,持续改进循环是怎样的?
当已部署的模型开始出现漂移时——无论是由于出现了新的缺陷类型、产品变更还是环境条件的变化——设备都会将运行数据发回云端。这些数据被输入到训练管道中,系统会训练出一个新模型并将其打包到容器中,随后通过 OTA 更新将更新后的容器推送至设备群。无论设备群中只有一台设备还是数千台设备,该循环的运作方式都是一样的。
有哪些安全措施可保护在Digi ConnectCore 95上运行的AI工作负载?
Digi TrustFence 提供基于硬件的安全防护,确保只有经过验证和签名的负载才能在设备上执行。Digi ConnectCore 云服务已通过SOC 2 Type 2认证,所有设备与云端之间的通信均采用基于证书的身份验证和TLS加密。
为什么该博客建议将复杂的任务拆分为两个较小的模型,而不是一个较大的模型?
较小的模型比较大的模型量化效果更佳。如果将定位和分类两项任务合并到一个模型中,在保证准确率不显著下降的前提下,针对边缘推理进行优化可能会更加困难。将任务拆分为两个更轻量级的模型——一个负责定位,一个负责分类——通常能获得更好的量化结果,且在优化过程中更易于管理。