钢铁研习所

← 全部场景

scenario l2 / 中长期 · 科学研究侧

仿真代理模型 Agent

用神经算子替代凝固、轧制、相变的 CFD/FEM 计算,把小时级仿真压到秒级,再让 Agent 在设计空间自动搜索

数据可得性

所需数据是否已在手、能否直接用于建模

工程难度

中高

从可行性验证到稳定上线的工程风险

实时性要求

需要秒级响应,还是天级出报告

评级为面向学习者的教学性判断,用于横向比较场景特点,不构成采购或投资建议。

涉及工序 / 3 道 · 高亮项点击可跳章节

原料准备
烧结·球团·焦化
废钢准备
电弧炉炼钢
转炉炼钢
炉外精炼
冷轧与深加工
检测与判定

业务痛点,讲人话

钢铁行业有一批算得很准但慢得没法用的模型。

连铸凝固传热的 FEM 模型能算出铸坯任意位置的温度场和壳厚分布,精度很高——但跑一个工况要几十分钟到几小时。轧制变形的有限元、加热炉的 CFD、相变动力学计算,都是类似情况。

这带来两个直接后果:

在线用不了。 产线要秒级响应,模型要几小时,只能离线算几个典型工况做成查表。工况一偏离,表就不准了。

设计空间搜不动。 想在几百个参数组合里找最优,每个组合算一小时,那就是几百小时。所以工程上只能在少数几个点上做对比。

代理模型要解决的就是这个:用神经网络学出机理模型的输入输出映射,把小时级压到秒级。

技术要点

ai engineer's view

  • 代理模型 ≈ 给慢函数加缓存层

    原函数(FEM 求解)正确但慢,代理模型学它的输入输出映射,在可信域内以千倍速度回答。关键是要知道什么时候不可信——缓存失效检测比缓存本身更重要。

  • 物理约束 ≈ 给模型加类型系统

    把守恒方程写进损失函数,等于在假设空间里排除掉一大批物理上非法的解。这在样本有限时能显著提升外推能力。

  • 训练集是设计出来的不是收集来的

    你可以主动选择在参数空间哪些位置生成样本。这跟一般机器学习「有什么数据用什么数据」完全不同——采样策略本身就是一个设计变量。

  • 验收标准要按下游用途定

    如果代理模型是给在线控制用,误差要求和延迟要求都很硬;如果是给设计空间搜索用,允许更大误差但要求梯度方向正确。两者的训练目标不一样。

三个典型对象

① 连铸凝固 输入:拉速、过热度、二冷水量分布、断面尺寸。输出:温度场、壳厚分布、凝固终点位置。 用途:在线预测壳厚(安全)、优化二冷配水(质量)、轻压下位置控制(中心偏析)。

② 轧制变形 输入:来料尺寸与温度、各机架压下量与速度。输出:变形抗力、轧制力、温降、板形。 用途:负荷分配优化、板形预设定、新钢种的规程快速试算。

③ 相变动力学 输入:成分、冷却路径。输出:各相体积分数、晶粒尺寸。 用途:层流冷却路径设计、TMCP 工艺窗口搜索、连接到 PSPP 逆向设计。

数据长什么样

data shape / 本场景吃哪几类数据

07机理与仿真mechanism models & simulation行业普遍成熟度 · 中高

冶金机理专业模型、CALPHAD 热力学与相图库、CFD/FEM 仿真结果、数字孪生生成数据

瓶颈:模型未工具化封装、没有统一调用接口——对 Agent 而言等于不存在

01生产过程时序process time-series行业普遍成熟度 ·

各工序工艺参数、L1/L2 控制信号、设备状态、振动与电流、能源计量读数

瓶颈:跨工序时空对齐;数据往往在客户/产线侧,取数是授权问题而非技术问题

05材料研发试验R&D experiments行业普遍成熟度 ·

熔炼/热处理/轧制/等静压工艺记录、力学性能、蠕变疲劳腐蚀长周期数据、失败案例

瓶颈:无统一实体定义、散落个人手中、失败数据普遍未留存、密级分类复杂

样例结构 / 教学示意,非真实产线数据

# 代理模型的训练样本:算出来的,不是收集来的(教学示意)
sample:
# 输入:在参数空间里主动采样(拉丁超立方 / 主动学习选点)
inputs:
  casting_speed_m_per_min: 1.15
  superheat_c: 28
  secondary_cooling:              # ★ 分段水量是一个向量不是标量
    zone1_l_per_min: 210
    zone2_l_per_min: 175
    zone3_l_per_min: 120
  section_mm: {width: 1250, thickness: 230}
  steel_grade_key: "…"            # 通过物性参数进入模型,不是 one-hot
#
# 输出:机理模型(FEM)算出来的场
outputs:
  shell_thickness_profile_mm: [12.4, 18.9, 24.1, "…"]   # 沿铸机长度
  surface_temp_profile_c: ["…"]
  metallurgical_length_m: 24.8    # 凝固终点位置
#
provenance:                       # ★ 必须记录:这条样本是谁算的、什么版本
  solver: "FEM-thermal-v…"
  mesh: "…"
  cpu_hours: 1.8
#
# 一条样本 ≈ 2 CPU 小时。几千条样本就是一次可观的算力投入——
# 但换来的是一个毫秒级可调用的模型。这就是「算力换数据」的字面含义。

注意 provenance 字段:代理模型的可信度上限由生成它的机理模型决定,所以求解器版本、网格、边界条件必须随样本一起存档。

七类数据全景见第 7 章 →

实施路径

第一步:挑一个已有可信机理模型的对象。 如果机理模型本身就不准,代理它没有意义。先验证机理模型在实测数据上的偏差水平。

第二步:设计采样策略,批量生成样本。 这一步纯烧算力,但可以完全并行、无人值守。

第三步:训练代理模型 + 不确定度估计。 不确定度不是可选项——你必须知道什么时候该退回去调机理模型。

第四步:用实测数据校准。 机理模型有简化假设,代理模型会忠实地继承这些误差。用少量实测数据做残差修正,是从"能算"到"能用"的关键一步。

必懂概念 / 6 张

ai engineer's view / 换成你熟悉的说法

  • 代理模型 ≈ 给慢函数加缓存层

    原函数(FEM 求解)正确但慢,代理模型学它的输入输出映射,在可信域内以千倍速度回答。关键是知道什么时候不可信。

  • 唯一能绕过历史数据缺口的科学场景

    训练样本可以用机理模型自己算出来——算力换数据。这也是它算力吸纳能力最强的原因。

  • 物理约束 ≈ 给模型加类型系统

    把守恒方程写进损失函数,等于在假设空间里排除掉一大批物理上非法的解。

延伸学习

相关场景