工业时序数据
industrial time-series data
钢厂数据的主体形态。看起来标准,坑却不少:压缩、缺失、时钟漂移、位号语义。
ai engineer's view
看起来是标准 metrics 流,实则每个字段都有历史包袱。位号字典整理相当于给一个没有文档的老系统补 schema。
工业时序数据由「位号(tag)+ 时间戳 + 值 + 质量码」构成,存在实时数据库里。听起来简单,实际使用时的坑:
- 有损压缩:实时库普遍默认开启旋转门压缩,只在值变化超过阈值时存点。你以为是秒级采样,其实是变频存储,直接做等间隔重采样会引入伪影
- 质量码:每个点都带一个质量标志(好/坏/不确定),忽略它会把传感器故障期的假值当真值
- 时钟漂移:不同系统的时钟未必严格同步,跨系统关联时几秒的偏差可能就毁掉对齐
- 位号语义:位号名往往是几十年前定的缩写,语义只在老师傅脑子里。位号字典的整理常常是数据项目的第一个大工程
- 停机与工况切换:数据里混着停机、检修、异常工况的段落,不剔除会严重污染训练集
这些不是理论问题,是每个工业数据项目实际都会遇到的第一批障碍。