scenario s2 / 短期 · 生产研发侧
质量溯因 Agent:从缺陷反查工艺
不止于检出缺陷,而是反查上游工艺参数窗口、定位责任工序、给出整改建议
数据可得性
中高
所需数据是否已在手、能否直接用于建模
工程难度
中高
从可行性验证到稳定上线的工程风险
实时性要求
中
需要秒级响应,还是天级出报告
评级为面向学习者的教学性判断,用于横向比较场景特点,不构成采购或投资建议。
涉及工序 / 7 道 · 高亮项点击可跳章节
业务痛点,讲人话
表面检测系统报告:某卷带钢距头部 3000 米处有一个划伤。
然后呢?
现有的表检系统大多止步于此——检出、分类、判级。这确实有用(能拦住不合格品),但价值链最肥的一段在后面:
这个缺陷是哪个工序造成的?是什么参数越界了?下一卷怎么避免?
一个只会告诉你"这里有缺陷"的系统,本质上是个高级质检员。而能回答"因为 3 号机架的辊子有损伤"的系统,才真正参与了生产改进。
按行业普遍经验,溯因带来的工艺改进收益,往往是单纯检出收益的数倍——因为检出只能拦住已经变成废品的钢,而溯因能防止下一批继续废。
时空对齐:这个场景真正的门槛
要溯因,你需要沿着物料血缘一路回查:
带钢卷 #C2024xxxx,位置 3000 m
↓ 卷取速度 + 时间戳反推
精轧机组通过时刻 T₁ → 取 T₁ 附近各机架的压下量、张力、温度
↓ 轧制延伸比换算
对应板坯位置 → 板坯号 #S2024xxxx
↓ 连铸切割记录
铸坯位置 → 浇次内序号
↓ 浇次-炉次映射
炉号 #H2024xxxx → 取这一炉的炼钢与精炼全部记录
ai engineer's view
这是一次分布式追踪
缺陷是终端报错,你要沿 trace 一路回查是哪个上游服务出的问题。区别在于:钢厂的 trace id 不会自动传播,得靠位置检测和逻辑推算算出来,而且会经历一对多的分裂(一块坯轧成一卷再分成多卷)。
join key 是物料位置不是时间戳
两边都带误差,只能做窗口内的概率匹配。实践中要显式建模误差窗口,而不是假装能精确对齐。
先用规则,再用模型
周期性缺陷(固定间隔出现)直接对应某个辊子的周长——纯规则推理,比任何模型都准。能用确定性规则定位的,不要交给概率模型猜。
数据长什么样
data shape / 本场景吃哪几类数据
表面检测图像、产线视频、红外热像、火焰与料面图像
瓶颈:缺陷长尾分布、伪缺陷干扰、跨产线泛化差
各工序工艺参数、L1/L2 控制信号、设备状态、振动与电流、能源计量读数
瓶颈:跨工序时空对齐;数据往往在客户/产线侧,取数是授权问题而非技术问题
金相图像、SEM/EBSD/TEM、XRD 谱图、光谱数据
瓶颈:标注强依赖专家;不同标准体系的评级口径不统一
技术报告、专利、论文、操作规程、设备手册、检修工单、报警日志
瓶颈:非结构化、密级混杂、时效性标注缺失(哪版规程还有效?)
样例结构 / 教学示意,非真实产线数据
# 一条溯因证据链(教学示意) defect: coil_id: "C-2024-XXXX" position_m: 3000.4 surface: "top" class: "roll_mark" # 表检模型给出的分类 confidence: 0.87 periodicity_m: 1.57 # ★ 关键线索:周期性 # aligned_context: # 时空对齐后拉到的上游数据 rolling: timestamp: "2024-XX-XX 14:32:07" stand: "F5" roll_diameter_mm: 500 # 周长 ≈ 1.57 m —— 与缺陷周期吻合 rolling_force_kN: 18400 work_roll_campaign_t: 3120 # 该轧辊已服役吨位 slab_id: "S-2024-XXXX" heat_id: "H-2024-XXXX" # hypothesis: cause: "F5 工作辊表面损伤" evidence: ["缺陷周期与 F5 辊周长吻合", "该辊服役吨位接近换辊上限"] action: "建议提前换辊并检查辊面"
注意 periodicity 这一项:它把一个视觉分类问题变成了确定性的几何匹配问题。做溯因时,优先寻找这类强线索。
分层设计
一个可行的溯因 Agent 大致分三层,从确定到不确定:
第一层:规则匹配(确定性最高) 周期性缺陷 → 匹配设备周长;缺陷集中在带钢边部 → 指向边部温度或铸坯角部;缺陷集中在某个炉次的所有卷 → 指向炼钢洁净度。
第二层:统计归因 把该缺陷出现与不出现的样本对比,在高维工艺参数空间里找出哪几维分布显著不同。这是特征归因问题,可解释性要求高于精度。
第三层:LLM 综合与解释 把前两层的证据、历史相似案例、工艺规程知识组织成一份人能看懂的溯因报告,并给出整改建议。
必懂概念 / 8 张
ai engineer's view / 换成你熟悉的说法
溯因 ≈ 分布式追踪
缺陷是终端报错,你要沿着 trace 一路回查是哪个上游服务出了问题。区别在于:钢厂的 trace id 不是自带的,得靠物料跟踪算出来。
时空对齐 ≈ 流式 join
带钢第 3000 米处的缺陷,对应的是 40 分钟前某个炉次、20 分钟前某个机架的参数。这是一次按物料位置而非时间戳做的 join。
工艺窗口 ≈ 参数的合法区间
每个工艺参数都有一个不出缺陷的区间。溯因本质是在高维参数空间里找出哪几维越界了——特征归因问题。
延伸学习
相关场景