制造业的数据价值有个悖论:产线每天产生大量数据,但能用于建模的极少。问题不在数据量,在于数据结构。
| 层级 | 内容 | 可直接用于建模 |
|---|---|---|
| 原始信号 | 电流、振动、温度、位移的连续采样 | 否,需特征提取 |
| 过程参数 | 砂轮线速度、进给量、工件转速、冷却压力 | 部分,需与结果配对 |
| 结果指标 | 圆度、圆柱度、粗糙度 Ra、尺寸偏差 | 是,作为标签 |
三层数据的采集频率、精度要求、存储成本差异很大。常见错误是把三层混在一起存成一张大表,结果既难查询也难建模。
研磨过程中,参数不是恒定值——粗磨、精磨、光磨各阶段的进给量和转速都不同。一条研磨记录必须切分成阶段,每个阶段单独标注参数,否则整条记录的"平均进给量"没有物理意义。
以下记录必须剔除,否则污染训练集:
把工件材质、硬度、批次、砂轮规格、修整间隔等外部信息补进每条记录。这一步最容易被跳过,但它是模型能否泛化的关键。
结果指标由质检记录提供。若检测是抽检而非全检,需明确标注"未检测"而非补零——补零会引入系统性偏差。
多数中小制造企业的产线数据量在千条级别,远达不到深度学习的要求。可行的路径有三条:
关键判断:数据量不足以支撑端到端模型时,强行上深度学习,结果一定不可用。此时经验公式 + 少量数据校正,反而更可靠。
当"参数—结果"配对记录持续积累,会形成正向循环:
这个循环的价值不在单次优化的幅度,而在持续累积的过程资产:设备交付后,使用时间越长,积累的可用数据越多,工艺知识越完整。
延伸阅读:尚美电气的胶辊研磨机、打印机滚筒研磨机等设备线,即按上述数据结构化路径推进。