chapter 07 / 横切 / 约 17 分钟
工厂自动化与数据体系
L0–L4:钢厂里藏着一整套「嵌入式 → 中间件 → 微服务 → 数仓」的技术栈
这一章大概是全站你最容易共鸣的一章。因为钢厂的信息系统架构,跟你熟悉的技术栈有一个近乎完美的对应关系:
从嵌入式实时系统,到中间件与模型服务,到微服务与工作流,再到数据仓库。 只不过它们在这个行业里叫 L0 到 L4,而且已经这样运行了三四十年。
搞清楚这五层,你就知道自己的模型该往哪儿放、数据该从哪儿取、哪些地方碰不得。
ISA-95:钢厂的技术栈地图
isa-95 pyramid / 教学示意
点击各层:它管什么、什么节奏、对应 IT 世界的哪一层、AI 能不能碰
越往下:延迟越低、约束越硬、越不许你碰
L2 · 过程控制
process model工艺模型计算设定值、过程优化
钢厂传统的「模型层」,大多基于冶金机理方程加经验系数,几十年来靠现场调参维持精度。共同弱点是难以适应新钢种、参数漂移后要人工重调。
- 典型系统
- 二级模型系统(终点预报、炉温设定、负荷分配、配水模型)
- 数据节奏
- 秒 ~ 分钟
★ AI 最自然的接入点。不是替换机理模型,而是给它加残差修正、用代理模型加速、或做在线自适应。
相关概念
几个值得展开的点:
L1 是禁区,但不是因为技术。 行业不让 AI 进控制回路,不是因为模型不够准,而是因为一个概率性的系统无法通过安全完整性等级的论证。L1 的工程文化要求逻辑可被工程师逐条审查、扫描周期确定、变更走安全评审。这跟"模型在 99.7% 的情况下表现良好"是两种世界观。
L2 是最被低估的接入点。 钢厂里早就有一层"模型服务"——行业管它叫二级模型:转炉的终点预报、加热炉的炉温设定、轧机的负荷分配、连铸的二冷配水。它们大多建于几十年前,基于机理方程加经验系数,靠现场调参维持精度。
这意味着什么?接口是现成的。 二级模型本来就以"输入工况 → 输出设定值"的形式存在,你不需要说服任何人接受一个全新的系统,只需要让现有模型算得更准:
- 用数据驱动方法修正机理模型的系统偏差(混合建模)
- 用代理模型加速计算量大的机理模型
- 用在线学习自适应参数漂移
L3 的 MES 是取数首选。 因为它是唯一按物料而不是按设备组织数据的系统。你要做跨工序的质量溯因,起点几乎总是 MES 的物料谱系表。
跨工序追踪:这个行业最硬的数据问题
来看一个具体问题。热轧带钢卷取后,表检系统报告:距头部 3000 米处有一个缺陷。要溯因,你需要知道:
- 这个位置的钢,是什么时刻通过精轧机架的?
- 那个时刻各机架的参数是多少?
- 这段钢来自铸坯的哪个部位?
- 对应的是哪一炉钢水?
第 2 步是普通的时序查询,简单。难的是第 1、3、4 步——它们要求你能在「物料坐标系」和「时间坐标系」之间做变换。
这就是时空对齐。它的本质是:join key 不是时间戳,而是物料位置,而且两边都带误差。
对象-时间-空间:主键该怎么设计
上面那个问题背后,是一个更根本的建模原则。
在流程工业里,单靠一个 ID 无法唯一确定一个观测。你需要同时回答三个问题:
- 对象(Object)——哪块钢?哪一炉?哪个卷?
- 时间(Time)——什么时刻?在哪个工序阶段?
- 空间(Space)——产线的哪个位置?这块钢的哪个部位(头/中/尾、表面/心部)?
说"这卷钢的屈服强度"是不够精确的——要说"这卷钢的第 3000 米处、上表面,在 14:32 通过 F5 机架时"。
这个三元组就是跨工序 join 的复合主键设计原则,也是冶金本体建模的起点。缺任何一维,跨工序关联都会退化成不可靠的模糊匹配。
你会拿到什么样的数据
工业时序数据听起来很标准:位号 + 时间戳 + 值 + 质量码。实际用起来,坑集中在这几处:
| 坑 | 表现 | 后果 |
|---|---|---|
| 有损压缩 | 实时库默认开旋转门压缩,按变化幅度变频存点 | 你以为是秒级采样,直接等间隔重采样会引入伪影 |
| 质量码 | 每个点带好/坏/不确定标志 | 忽略它就把传感器故障期的假值当真值训练 |
| 时钟漂移 | 不同系统时钟未必同步 | 跨系统关联时几秒偏差就毁掉对齐 |
| 位号语义 | 位号名是几十年前定的缩写 | 位号字典整理常常是数据项目的第一个大工程 |
| 工况混杂 | 数据里混着停机、检修、异常段落 | 不剔除会严重污染训练集 |
这些不是理论问题。几乎每个工业数据项目,第一个月都在处理这些。
七类数据全景
把钢铁企业的数据资产做个粗分,大致七类。这个分类是全站描述"某个场景吃什么数据"的统一口径:
| # | 类别 | 行业普遍成熟度 | 核心瓶颈 |
|---|---|---|---|
| ① | 生产过程时序 | 高 | 跨工序对齐;数据常在客户侧,取数是授权问题 |
| ② | 产线视觉 | 高 | 缺陷长尾、伪缺陷、跨产线泛化 |
| ③ | 显微表征 | 中高 | 专家标注成本 |
| ④ | 检测与标准 | 中高 | 版本管理、判定链可追溯 |
| ⑤ | 材料研发试验 | 低 | 无统一实体定义、散落个人、失败数据未留存 |
| ⑥ | 知识文本 | 中 | 非结构化、密级混杂、时效标注缺失 |
| ⑦ | 机理与仿真 | 中高 | 模型未工具化封装,Agent 调不动 |
两个判断值得记住:
短期场景吃的是 ①②③④⑥,成熟度都在中等以上;中长期科学场景全部压在 ⑤ 上,而它恰恰是最弱的一环。 这就是为什么本站的中长期场景普遍标注"数据可得性 中低"——不是算法难,是燃料不够。
⑦ 是投入产出比最高的一项工程。 一家研究型企业可能积累上千个冶金机理模型,但如果它们只是散落的可执行文件和论文附录,对 Agent 来说等于不存在。
本体:为什么必须早做,又不能做大
最后回到架构层。
本体要回答的问题很朴素:在这个领域里,什么是一个"东西",东西之间有什么合法关系。
对钢铁行业,一个最小可用本体大约需要这几类实体:材料/牌号、工艺步骤、表征方法、标准条款,以及它们与生产对象(炉次、铸坯、卷)在时间和空间上的挂接关系。是否要把"设备"作为第五类实体纳入,是个见仁见智的问题——设备有寿命、有状态、会被复用,跟一次性的炉次性质不同。
两个相反方向的压力:
必须早做。 如果第一批场景不共用实体 ID,几个月后就是几个互不相通的烟囱,返工成本远高于前期投入。
不能做大。 完备本体做三年也做不完。可行的中间路线只有一条:最小可用本体 + 随场景演进。
还有一个常被忽略的理由——权限要挂在实体上。没有统一实体定义,就只能做到目录级授权;不敢做细粒度授权,就不敢开放跨部门调用;不敢开放调用,多智能体协同就无从谈起。
本体、权限、多 Agent 协同这三件事是咬合的。 短期场景靠现有能力能撑住;一旦进入十几个 Agent 跨部门协同的规模,这三层会同时成为瓶颈。
这一章支撑哪些 agent 场景 / 5 个
本章概念清单 / 14 张 · 点击进入概念卡片
chapter quiz
0/5 已答
Q1按 ISA-95 分层,AI 项目最主要的落点通常在哪一层?
Q2为什么说「没有物料跟踪,跨工序的 AI 分析就无从谈起」?
Q3从实时数据库里取出的历史时序数据,最容易踩的坑是什么?
Q4在排程调度场景里,LLM 的正确职责是什么?
Q5为什么说「机理模型没被工具化封装,对 Agent 而言等于不存在」?