钢铁研习所

← 全部场景

scenario s2 / 短期 · 生产研发侧

质量溯因 Agent:从缺陷反查工艺

不止于检出缺陷,而是反查上游工艺参数窗口、定位责任工序、给出整改建议

数据可得性

中高

所需数据是否已在手、能否直接用于建模

工程难度

中高

从可行性验证到稳定上线的工程风险

实时性要求

需要秒级响应,还是天级出报告

评级为面向学习者的教学性判断,用于横向比较场景特点,不构成采购或投资建议。

涉及工序 / 7 道 · 高亮项点击可跳章节

业务痛点,讲人话

表面检测系统报告:某卷带钢距头部 3000 米处有一个划伤。

然后呢?

现有的表检系统大多止步于此——检出、分类、判级。这确实有用(能拦住不合格品),但价值链最肥的一段在后面:

这个缺陷是哪个工序造成的?是什么参数越界了?下一卷怎么避免

一个只会告诉你"这里有缺陷"的系统,本质上是个高级质检员。而能回答"因为 3 号机架的辊子有损伤"的系统,才真正参与了生产改进。

按行业普遍经验,溯因带来的工艺改进收益,往往是单纯检出收益的数倍——因为检出只能拦住已经变成废品的钢,而溯因能防止下一批继续废。

时空对齐:这个场景真正的门槛

要溯因,你需要沿着物料血缘一路回查:

带钢卷 #C2024xxxx,位置 3000 m
   ↓ 卷取速度 + 时间戳反推
精轧机组通过时刻 T₁ → 取 T₁ 附近各机架的压下量、张力、温度
   ↓ 轧制延伸比换算
对应板坯位置 → 板坯号 #S2024xxxx
   ↓ 连铸切割记录
铸坯位置 → 浇次内序号
   ↓ 浇次-炉次映射
炉号 #H2024xxxx → 取这一炉的炼钢与精炼全部记录

ai engineer's view

  • 这是一次分布式追踪

    缺陷是终端报错,你要沿 trace 一路回查是哪个上游服务出的问题。区别在于:钢厂的 trace id 不会自动传播,得靠位置检测和逻辑推算算出来,而且会经历一对多的分裂(一块坯轧成一卷再分成多卷)。

  • join key 是物料位置不是时间戳

    两边都带误差,只能做窗口内的概率匹配。实践中要显式建模误差窗口,而不是假装能精确对齐。

  • 先用规则,再用模型

    周期性缺陷(固定间隔出现)直接对应某个辊子的周长——纯规则推理,比任何模型都准。能用确定性规则定位的,不要交给概率模型猜。

数据长什么样

data shape / 本场景吃哪几类数据

02产线视觉line vision行业普遍成熟度 ·

表面检测图像、产线视频、红外热像、火焰与料面图像

瓶颈:缺陷长尾分布、伪缺陷干扰、跨产线泛化差

01生产过程时序process time-series行业普遍成熟度 ·

各工序工艺参数、L1/L2 控制信号、设备状态、振动与电流、能源计量读数

瓶颈:跨工序时空对齐;数据往往在客户/产线侧,取数是授权问题而非技术问题

03显微表征microstructure characterization行业普遍成熟度 · 中高

金相图像、SEM/EBSD/TEM、XRD 谱图、光谱数据

瓶颈:标注强依赖专家;不同标准体系的评级口径不统一

06知识文本knowledge text行业普遍成熟度 ·

技术报告、专利、论文、操作规程、设备手册、检修工单、报警日志

瓶颈:非结构化、密级混杂、时效性标注缺失(哪版规程还有效?)

样例结构 / 教学示意,非真实产线数据

# 一条溯因证据链(教学示意)
defect:
coil_id: "C-2024-XXXX"
position_m: 3000.4
surface: "top"
class: "roll_mark"          # 表检模型给出的分类
confidence: 0.87
periodicity_m: 1.57         # ★ 关键线索:周期性
#
aligned_context:              # 时空对齐后拉到的上游数据
rolling:
  timestamp: "2024-XX-XX 14:32:07"
  stand: "F5"
  roll_diameter_mm: 500     # 周长 ≈ 1.57 m —— 与缺陷周期吻合
  rolling_force_kN: 18400
  work_roll_campaign_t: 3120  # 该轧辊已服役吨位
slab_id: "S-2024-XXXX"
heat_id: "H-2024-XXXX"
#
hypothesis:
cause: "F5 工作辊表面损伤"
evidence: ["缺陷周期与 F5 辊周长吻合", "该辊服役吨位接近换辊上限"]
action: "建议提前换辊并检查辊面"

注意 periodicity 这一项:它把一个视觉分类问题变成了确定性的几何匹配问题。做溯因时,优先寻找这类强线索。

七类数据全景见第 7 章 →

分层设计

一个可行的溯因 Agent 大致分三层,从确定到不确定:

第一层:规则匹配(确定性最高) 周期性缺陷 → 匹配设备周长;缺陷集中在带钢边部 → 指向边部温度或铸坯角部;缺陷集中在某个炉次的所有卷 → 指向炼钢洁净度。

第二层:统计归因 把该缺陷出现与不出现的样本对比,在高维工艺参数空间里找出哪几维分布显著不同。这是特征归因问题,可解释性要求高于精度。

第三层:LLM 综合与解释 把前两层的证据、历史相似案例、工艺规程知识组织成一份人能看懂的溯因报告,并给出整改建议。

必懂概念 / 8 张

ai engineer's view / 换成你熟悉的说法

  • 溯因 ≈ 分布式追踪

    缺陷是终端报错,你要沿着 trace 一路回查是哪个上游服务出了问题。区别在于:钢厂的 trace id 不是自带的,得靠物料跟踪算出来。

  • 时空对齐 ≈ 流式 join

    带钢第 3000 米处的缺陷,对应的是 40 分钟前某个炉次、20 分钟前某个机架的参数。这是一次按物料位置而非时间戳做的 join。

  • 工艺窗口 ≈ 参数的合法区间

    每个工艺参数都有一个不出缺陷的区间。溯因本质是在高维参数空间里找出哪几维越界了——特征归因问题。

延伸学习

相关场景