Dr. Lu随想|从“知道”到“做到”
来源: | 作者:pmod6d781 | 2026-08-19 | 61 次浏览 | 🔊 点击朗读正文 ❚❚ | 分享到:
编者按:这是Dr. Lu专栏“工业AI的完整体系”系列的第三篇。本系列的第一篇文章回答了“去哪儿”——工业需要自己的World Model。第二篇文章回答了“为什么”——在这个世界模型里,因果推理告诉我们根因在哪儿。今天来回答第三个问题:从“知道”到“做到”,中间隔着什么。

上一篇文章,我们停在了这里。

化工厂的值班工程师手里拿到了一份诊断:循环水泵的叶轮在磨损,建议切换备用泵,通知维修班组准备更换。因果推理链路清晰,每一步都有据可查。

但诊断不等于处方。处方不等于药到病除。

如果“切换备用泵”这个决策没有被送入控制系统——如果维修班组没有接到工单、如果备用泵切换时下游工艺没人协调、如果换完叶轮之后没有人去验证“振动真的降下来了”——那么前面所有的建模和推理,都停在纸面上。

从“知道”到“做到”,中间隔着的不是“再跑一遍模型”——是物理世界。

01 Physical AI 的三张面孔

Physical AI这个词,最容易让人想到机器人。

NVIDIA用Cosmos做物理仿真、生成海量虚拟训练数据。Physical Intelligence的π0.7让机械臂实现了零样本抓取——没见过的物体,第一次就能拿起来。特斯拉的Optimus已经上了产线试运行。这些都是已经真实发生的,都令人振奋。

这是Physical AI的第一张面孔:让机器学会动。它的核心问题是“怎么动”——关节力矩要多大、重心在哪里、碰到障碍物怎么绕。

在NVIDIA的蓝图里,还有第二张面孔:在数字世界里先跑一遍,再到真实世界里执行。这套体系由三个支柱撑起来——Cosmos(世界模型,训练数据的工厂)、Isaac(仿真和部署平台)、Omniverse(数字孪生协作层)。一个机器人可以在仿真里摔碎一千个鸡蛋学会怎么抓,一个自动驾驶系统可以在仿真里跑一百万公里学会怎么变道——然后才上路。

但这两张面孔——机器人硬件和仿真-部署体系——面对工厂的时候,碰到了同一个问题。

工厂里大部分的生产活动是由既有的设备(包括传统工业机器人)在执行,特别是在自动化程度高的工业企业里,可以由具身智能机器人来执行的只是非常小的一部分之前由人类操作工负责的工作。在工厂里要“做到”,不能只考虑具身智能的需要,而要重点考虑现有设备的操作。

因此工业需要Physical AI的第三张面孔:把AI的判断送入控制系统——不是控制一台机械臂,是控制DCS、PLC、MES。它的“身体”不是关节力矩,是参数设定、控制回路调参、工艺边界校验。它的首要目标不是“能动”,是“能正常生产”。

一个更根本的差异:机器人Physical AI的核心挑战是sim-to-real gap——仿真里训练的策略放到真实世界,摩擦力不一样、光照不一样、传感器的噪声不一样。而工业Physical AI的“仿真”是什么?是热力学方程、流体力学方程、泵的特性曲线。工业场景的sim-to-real gap天然比机器人场景小得多——这不是因为工业AI更强,是因为它面对的系统诞生之日自带先验知识。

这意味着什么?意味着工业Physical AI的五级自主阶梯,有可能走得比机器人行业更快。

02 从人盯着到逐步放手——五级自主阶梯

很多人以为Physical AI的核心是“自动化程度”——人参与得越少越好。但这个思路在工业现场不成立。

不是因为技术做不到。是因为安全文化要求可追溯的决策链。AI告诉值长“把负荷降到85%”,值长执行了,出事了,查不回来为什么——责任是他自己的。所以工业场景中,每往上升一级自主权,前置条件不是“算法更好”,是“在生产现场证明了足够多的安全记录”。

当前AI控制工业系统的主流处于这样一个位置上:

L0 人工接管。AI给建议,人确认之后,通过DCS/MES下发执行指令。这是今天绝大多数工业AI应用的真实状态——而且这个状态不是暂时的。它是设计选择,不是能力瓶颈。

L1 建议+确认。AI给出基于综合状态评估的协同建议——不只是一条孤立的参数推荐,而是“调了这个参数之后,相关的参数会受什么影响、下游工艺需要注意什么”。人审核确认后执行。这是从L0往L1的过渡期,正在发生。

L2 可否决。AI推送建议,N分钟内如果没有人否决,自动下发。自动下发的前提非常苛刻:在L0、L1阶段采纳率超过目标门槛(例如至少85%),安全事件零记录,风险评估全部通过。这个阶段的门槛不是代码,是前期AI在辅助控制决策过程中获得的信任。

L3 半自主。AI执行,人事后审查。到了这一步,可以对接机器人,包括传统机器人(如巡检机器人)和具身机器人——机器人带着“去看什么、什么是异常、看到异常之后怎么办”的指令去现场,回来之后AI把巡检结果融进状态评估里,更新策略。

L4 全自主。远期远景。对于一些高危、高安全需求行业(如核电站)来说,这可能永远不需要“全自主”——因为人留在一个高效的Human-in-the-loop里,本身就是最优解。

推动工业AI向自主阶梯的更高阶升级的过程中,每一点进步,都需要在生产现场花费真金白银来验证过,都有代价,因此需要走得更扎实。不像互联网产品可以大胆试错,A/B测试、灰度发布、上线之后效果不好回滚就行。

人贵在知行合一,工业AI也一样——不是你知道了就能做到,是你必须在做的过程中持续验证你知道的到底对不对。每一个“执行→观察→校准”的循环,都在加固下一个决策的可信度。

03 闭环的核心不是执行,是反馈

很多人以为Physical AI的核心是“执行”——把决策送进控制系统就完事了。但闭环的核心从来不是执行,是反馈。

你切了备用泵。振动降下来了没有?下游工艺的温度和压力有没有波动?如果振动降了但下游工艺不稳定,这是切换操作本身的问题,还是切换的时机不对?

这些问题不能靠“再跑一遍模型”回答。它们需要双层反馈回路。

第一层是操作反馈:状态估计准不准?调控策略对不对?每一次“建议→执行→观察”之后,系统要知道“这次我猜对了吗”。如果猜错了,是传感器的问题、模型参数漂移了、还是工况变了。

第二层是管理反馈:经济指标改善了没有?策略方向需要调整吗?这台泵换了叶轮之后,平均故障间隔时间有没有拉长?这个型号的泵在某些工况下就是更容易磨损——要不要修改预防性维护策略?

没有这两层反馈,“做到”可能变成“持续地做错”。你以为你在朝着正确的方向执行,但实际上每一次执行都在错误的方向上累积偏差。

这也是当前工业AI产品化最缺的一环——不是缺执行能力,是缺对执行效果的持续验证能力。人盯着看、人判断“行不行”——这是当下的现实。但下一步要做的,是让这个验证机制本身半自动化:系统自己判断“这次调控达到了预期的状态转移目标”,而不是等人来点“采纳”按钮。

04 工业需要自己的“语义层”

NVIDIA烧了几百亿美元,用Cosmos、Isaac、Omniverse三件套搭好了Physical AI的基础设施。但这里有一个所有人都忽视的缺口。

机器人可以走、可以看、可以拍照。但它不知道“泵的轴承磨损在什么样的振动频谱上才能看出来”、不知道“一根管道表面的轻微变色和严重腐蚀之间差了几年”、不知道“这台设备在满负荷工况下和半负荷工况下,巡检频率应该差多少”。

通用物理仿真解决了“让机器动起来”。但动起来之后,面对的是一个对它来说完全沉默的工厂。它需要有人告诉它三件事。

看什么。一台循环水泵有多少个巡检点——轴承座的温度测点、密封处的泄漏观察口、联轴器的对中标记。这是设备物理结构决定的,是工业本体模型里已经画好的。

什么是异常。振动从2mm/s升到4mm/s,还在正常范围内吗?还是已经越过了从“正常磨损”到“加速退化”的拐点?这个拐点不是一个固定数值——它取决于当前工况、设备已运行时长、历史上同类设备的退化曲线。

看到异常后怎么办。这不是“发一条报警推送”就够了。是要把异常放在因果链里定位——这个异常是上游工艺参数波动的“果”还是下游联锁停机的“因”?紧急程度是“下周检修窗口处理”还是“今晚必须切备用”?

这三件事,正是工业本体模型的核心能力。它给物理AI装上语义层——不是让机器更灵活,是让机器知道“在这个具体场景里,什么是对、什么是错、这个操作意味着什么”。

这就是工业Physical AI与机器人Physical AI最根本的分野。不是在硬件层面竞争,不是在算法层面竞争,而是在语义层——谁能告诉机器“在这个工厂里,事情是这么运转的”。

05 结语

本系列的第一篇文章回答了“去哪儿”——工业需要自己的World Model,不是四条学术路线里的任何一种,而是以已知结构为骨架的第五条路线。

第二篇文章回答了“为什么”——在这个世界模型上,因果推理不是在数据里找模式,是在一个正确的骨架上追问。

本文回答了“怎么做”——把诊断变成行动,把人盯着变成逐步放手,把执行之后的反馈回路变成制度,以及给所有能动起来的机器装上“知道为什么动”的语义层。

三件事讲完了。但读者可能会问一个更朴素的问题:这三者合在一起,到底能给我的工厂带来什么?

下周见。

Dr. Lu · 2026年8月


关于作者:Dr. Lu,昆仑数据创始人陆薇。虽然是计算机博士,大部分时间不在机房,而在工厂和去工厂的路上。20年来专注一件事:让数据真正理解工业。她是IEEE TCSVC Woman in Services Computing第一位华人女性获奖者,也是最早参与制定中国工业大数据路线图的那批人之一。这个专栏是她在一线的思考——关于工业AI、关于本体模型和控制论、关于AI在工厂落地那些事儿和人。