制造业的数据价值有个悖论:产线每天产生大量数据,但能用于建模的极少。问题不在数据量,在于数据结构。

一、研磨数据的三个层级

层级内容可直接用于建模
原始信号电流、振动、温度、位移的连续采样否,需特征提取
过程参数砂轮线速度、进给量、工件转速、冷却压力部分,需与结果配对
结果指标圆度、圆柱度、粗糙度 Ra、尺寸偏差是,作为标签

三层数据的采集频率、精度要求、存储成本差异很大。常见错误是把三层混在一起存成一张大表,结果既难查询也难建模。

二、从原始数据到可建模数据集:四步

第 1 步:时间对齐

研磨过程中,参数不是恒定值——粗磨、精磨、光磨各阶段的进给量和转速都不同。一条研磨记录必须切分成阶段,每个阶段单独标注参数,否则整条记录的"平均进给量"没有物理意义。

第 2 步:异常剔除

以下记录必须剔除,否则污染训练集:

第 3 步:上下文补全

把工件材质、硬度、批次、砂轮规格、修整间隔等外部信息补进每条记录。这一步最容易被跳过,但它是模型能否泛化的关键。

第 4 步:标注

结果指标由质检记录提供。若检测是抽检而非全检,需明确标注"未检测"而非补零——补零会引入系统性偏差。

三、小样本条件下的建模路径

多数中小制造企业的产线数据量在千条级别,远达不到深度学习的要求。可行的路径有三条:

  1. 先做参数推荐而非端到端预测。用统计方法(响应面、回归)建立参数—结果的经验关系,虽精度有限但可解释、可落地。
  2. 用物理约束压缩搜索空间。研磨的去除率有几何关系约束,模型的输出必须落在物理可行域内。
  3. 迁移同族工序的知识。同类设备、相近材料的加工经验可以迁移,不必从零积累。

关键判断:数据量不足以支撑端到端模型时,强行上深度学习,结果一定不可用。此时经验公式 + 少量数据校正,反而更可靠。

四、数据飞轮转起来之后

当"参数—结果"配对记录持续积累,会形成正向循环:

这个循环的价值不在单次优化的幅度,而在持续累积的过程资产:设备交付后,使用时间越长,积累的可用数据越多,工艺知识越完整。

延伸阅读:尚美电气的胶辊研磨机、打印机滚筒研磨机等设备线,即按上述数据结构化路径推进。