scenario l2 / 中长期 · 科学研究侧
仿真代理模型 Agent
用神经算子替代凝固、轧制、相变的 CFD/FEM 计算,把小时级仿真压到秒级,再让 Agent 在设计空间自动搜索
数据可得性
中
所需数据是否已在手、能否直接用于建模
工程难度
中高
从可行性验证到稳定上线的工程风险
实时性要求
低
需要秒级响应,还是天级出报告
评级为面向学习者的教学性判断,用于横向比较场景特点,不构成采购或投资建议。
涉及工序 / 3 道 · 高亮项点击可跳章节
业务痛点,讲人话
钢铁行业有一批算得很准但慢得没法用的模型。
连铸凝固传热的 FEM 模型能算出铸坯任意位置的温度场和壳厚分布,精度很高——但跑一个工况要几十分钟到几小时。轧制变形的有限元、加热炉的 CFD、相变动力学计算,都是类似情况。
这带来两个直接后果:
在线用不了。 产线要秒级响应,模型要几小时,只能离线算几个典型工况做成查表。工况一偏离,表就不准了。
设计空间搜不动。 想在几百个参数组合里找最优,每个组合算一小时,那就是几百小时。所以工程上只能在少数几个点上做对比。
代理模型要解决的就是这个:用神经网络学出机理模型的输入输出映射,把小时级压到秒级。
技术要点
ai engineer's view
代理模型 ≈ 给慢函数加缓存层
原函数(FEM 求解)正确但慢,代理模型学它的输入输出映射,在可信域内以千倍速度回答。关键是要知道什么时候不可信——缓存失效检测比缓存本身更重要。
物理约束 ≈ 给模型加类型系统
把守恒方程写进损失函数,等于在假设空间里排除掉一大批物理上非法的解。这在样本有限时能显著提升外推能力。
训练集是设计出来的不是收集来的
你可以主动选择在参数空间哪些位置生成样本。这跟一般机器学习「有什么数据用什么数据」完全不同——采样策略本身就是一个设计变量。
验收标准要按下游用途定
如果代理模型是给在线控制用,误差要求和延迟要求都很硬;如果是给设计空间搜索用,允许更大误差但要求梯度方向正确。两者的训练目标不一样。
三个典型对象
① 连铸凝固 输入:拉速、过热度、二冷水量分布、断面尺寸。输出:温度场、壳厚分布、凝固终点位置。 用途:在线预测壳厚(安全)、优化二冷配水(质量)、轻压下位置控制(中心偏析)。
② 轧制变形 输入:来料尺寸与温度、各机架压下量与速度。输出:变形抗力、轧制力、温降、板形。 用途:负荷分配优化、板形预设定、新钢种的规程快速试算。
③ 相变动力学 输入:成分、冷却路径。输出:各相体积分数、晶粒尺寸。 用途:层流冷却路径设计、TMCP 工艺窗口搜索、连接到 PSPP 逆向设计。
数据长什么样
data shape / 本场景吃哪几类数据
冶金机理专业模型、CALPHAD 热力学与相图库、CFD/FEM 仿真结果、数字孪生生成数据
瓶颈:模型未工具化封装、没有统一调用接口——对 Agent 而言等于不存在
各工序工艺参数、L1/L2 控制信号、设备状态、振动与电流、能源计量读数
瓶颈:跨工序时空对齐;数据往往在客户/产线侧,取数是授权问题而非技术问题
熔炼/热处理/轧制/等静压工艺记录、力学性能、蠕变疲劳腐蚀长周期数据、失败案例
瓶颈:无统一实体定义、散落个人手中、失败数据普遍未留存、密级分类复杂
样例结构 / 教学示意,非真实产线数据
# 代理模型的训练样本:算出来的,不是收集来的(教学示意)
sample:
# 输入:在参数空间里主动采样(拉丁超立方 / 主动学习选点)
inputs:
casting_speed_m_per_min: 1.15
superheat_c: 28
secondary_cooling: # ★ 分段水量是一个向量不是标量
zone1_l_per_min: 210
zone2_l_per_min: 175
zone3_l_per_min: 120
section_mm: {width: 1250, thickness: 230}
steel_grade_key: "…" # 通过物性参数进入模型,不是 one-hot
#
# 输出:机理模型(FEM)算出来的场
outputs:
shell_thickness_profile_mm: [12.4, 18.9, 24.1, "…"] # 沿铸机长度
surface_temp_profile_c: ["…"]
metallurgical_length_m: 24.8 # 凝固终点位置
#
provenance: # ★ 必须记录:这条样本是谁算的、什么版本
solver: "FEM-thermal-v…"
mesh: "…"
cpu_hours: 1.8
#
# 一条样本 ≈ 2 CPU 小时。几千条样本就是一次可观的算力投入——
# 但换来的是一个毫秒级可调用的模型。这就是「算力换数据」的字面含义。注意 provenance 字段:代理模型的可信度上限由生成它的机理模型决定,所以求解器版本、网格、边界条件必须随样本一起存档。
实施路径
第一步:挑一个已有可信机理模型的对象。 如果机理模型本身就不准,代理它没有意义。先验证机理模型在实测数据上的偏差水平。
第二步:设计采样策略,批量生成样本。 这一步纯烧算力,但可以完全并行、无人值守。
第三步:训练代理模型 + 不确定度估计。 不确定度不是可选项——你必须知道什么时候该退回去调机理模型。
第四步:用实测数据校准。 机理模型有简化假设,代理模型会忠实地继承这些误差。用少量实测数据做残差修正,是从"能算"到"能用"的关键一步。
必懂概念 / 6 张
ai engineer's view / 换成你熟悉的说法
代理模型 ≈ 给慢函数加缓存层
原函数(FEM 求解)正确但慢,代理模型学它的输入输出映射,在可信域内以千倍速度回答。关键是知道什么时候不可信。
唯一能绕过历史数据缺口的科学场景
训练样本可以用机理模型自己算出来——算力换数据。这也是它算力吸纳能力最强的原因。
物理约束 ≈ 给模型加类型系统
把守恒方程写进损失函数,等于在假设空间里排除掉一大批物理上非法的解。
延伸学习
相关场景