编者按:这是Dr. Lu 专栏“工业AI的完整体系”系列文章的第一篇。最近World Model、Causal AI、Physical AI三个概念在AI圈被推到风口,但它们跟工业界到底有什么关系?这个系列用四篇文章逐一拆解——从“世界”到“追问”到“行动”,最终汇聚到同一个答案:工业本体模型。
最近World Model这个词在AI圈突然热了。
李飞飞的World Labs融资10亿美元做空间智能。LeCun说World Model是通往AGI的必经之路。NVIDIA把Cosmos 2开源给机器人和自动驾驶开发者。Sora 2生成的视频让人分不清真假。
我身边的工业朋友都在看热闹,然后转头问我一个朴素的问题:我的工厂不需要生成视频,不需要3D重建车间,也不需要AI在Minecraft里学会走路——这些跟我到底有什么关系?
我的答案是:有关系。但不是你想的那种关系。
放下学术定义,用一个场景讲清楚。
一个自动驾驶系统要变道,它需要在“脑子”里模拟三件事:如果我打方向盘15度,三秒后车会在什么位置?旁边的车会怎么反应?这个操作安不安全?
这三件事,分别对应World Model的三个核心能力:环境表征(车和路在哪里)、状态预测(打了方向盘之后会发生什么)、安全评估(这个结果能不能接受)。
World Model的根本目标,就是让AI在行动之前,先在内部模拟一遍行动的后果。就像一个有经验的老工人,动手之前会在脑子里把流程过一遍;AI也需要这样一个"内部预演"的能力——而不是直接拿真车、真炉子去试错。
道理不难懂。但问题来了:这个“脑子里的模拟”到底怎么构建?
这正是学术界四条路线分叉的地方。
代表人物:Yann LeCun。代表架构:JEPA、DreamerV3。
核心思路:不在像素层面重建世界,而是在一个压缩的“特征空间”里做预测。关键创新,是把视觉输入从高维像素压缩到低维潜空间,只保留和决策相关的特征——一个交通场景里,每片树叶的纹理变化不重要,但前车的刹车灯亮了,这个信号必须被抓住。
技术里程碑:V-JEPA 2以1/50的算力追平生成式模型。
对工厂的启示:设备的振动、温度、压力变化不需要像素级重建,工业世界模型的输入可以比自动驾驶更精简。但潜空间的可解释性是弱点——特征是人看不懂的向量。这在工业里可能是致命问题:值长不会听一个说不清理由的向量的话。
代表作品:Sora 2、Genie 3、Cosmos 2。
核心思路:用扩散模型或自回归Transformer直接生成未来帧。它不是"理解"世界,而是"画"出世界的样子。
优势是视觉质量极高——Sora 2生成的视频已经以假乱真。但最大的问题是:物理一致性不保证。生成的画面里灯泡能点亮,但用的是错误的物理原理——画面合理,物理错了。
对工厂来说这是致命伤。工厂里没有人要“看起来对的画面”,大家要的是"算得准的预测"。
代表人物:李飞飞(World Labs)。
核心思路:从2D图像生成3D场景,让AI可以在其中漫游。持久性好——离开一个场景再回来,它还在那里。
但交互性目前仅限于导航:可以“走”,不能“操作”。对工业来说,知道空间结构有用,但不够——更关键的是在这个空间里做决策。
代表项目:Genesis。
核心思路:把物理引擎和生成式渲染结合,显式地把重力、摩擦力、热传导这些方程写进模型。优势是物理一致性有保证,而且一张RTX 4090就能跑。
但它的艺术自由度低:在简化的虚拟世界里很棒,面对真实工厂的复杂性和非标设备就吃力了。

把这四条路线放在一起看,你会发现它们有一个共同的假设:AI面对的,是一个需要从零学习的、未知的世界。
LeCun的潜空间预测,需要海量视频来训练特征提取器。Sora 2需要互联网级别的视频数据来学会“绘画”。World Labs需要大量2D图片来重建3D场景。Genesis假设物理定律需要被显式编码进仿真引擎。
它们都在回答同一个问题:怎么让AI从无到有地“长出”一个世界。
但工厂不是未知世界。
热力学定律不用从数据里重新发现——它写在教科书里。设备之间的连接关系不用AI去猜——它画在图纸上。正常运行边界不用试探——它写在操作规程里。设备故障的因果链条不用大海捞针——它沉淀在几十年的故障记录和老师傅的经验里。
如果把World Model理解为一个AI“理解世界”的引擎,那就存在第五条路线——不是从零学习,而是从一个已知的骨架出发。
回到那个自动驾驶的例子。一辆自动驾驶汽车要变道,它在脑子里模拟的是“如果打方向盘15度,三秒后车在什么位置”。它用一个学出来的环境表征来做内部预演。
现在换一个场景。
一个化工厂的值班工程师,盯着屏幕上的循环水泵,出口压力在缓慢往下掉。他脑子里模拟的是什么?
泵的叶轮是不是磨损了,还是进了空气(气蚀)?→ 如果不管它继续跑,轴承温度和振动会怎么发展 → 要不要切到备用泵 → 切换的这几分钟,下游工艺会不会受影响 → 有没有安全风险。
注意,这里发生的一切,和自动驾驶的“内部预演”有本质区别:
这里不是“从视频数据中学出环境表征”。这里的输入,是实时监控系统的数据、设备台账和工艺手册、老师傅二十年的经验判断。这里的模拟,是基于已知物理方程的计算——泵的特性曲线、流体力学、热平衡——而不是潜空间中的向量外推。
“工业 World Model”和“学术 World Model”的根本差异在于:学术路线追求的是从数据中学习世界的通用表征——这是为了构建能应对新环境的通用AI;工业路线追求的,是在已知物理系统上做精确的状态预测和推理——这是为了在现有工厂中做出可信的决策。
这两个方向不是对错问题,是目标不同。
学术World Model要的是“泛化能力”——学到的东西能从一座城市迁移到另一座城市。工业World Model要的是“精确能力”——对这一个化工厂、这一台水泵的预测误差,不能超过工艺可接受的偏差范围。
这就是为什么“结构已知性”是工业做World Model最大的先验优势:你不需要让AI从海量数据里重新发现热力学,因为热力学已经写在教科书和仿真软件里了。你要做的是把这些已有的结构知识,和这座工厂的具体运行数据结合在一起——以结构为骨架,数据填血肉。
所以,工业AI需要World Model,但不是四条路线里的任何一种。它需要的是第五种:以工业已知结构为骨架,用实时数据做血肉,在物理方程和操作经验的约束下做精确预测——而不是在像素空间里生成漂亮的画面。
两千年前,塞涅卡说过一句话:如果一个人不知道要驶向哪个港口,那么什么风都不是顺风。
过去几十年,工业界从来不缺数据,缺的是一个明确的方向。现在方向有了——“世界”这个港口,我们认下来了。
但船不会自己动。要让这艘船开起来,还需要知道风从哪里来:这台泵的振动为什么异常?出口压力为什么在往下掉?设备和设备之间,到底是什么关系?
那需要另一件工业界一直拥有、学术界耕耘了几十年、最近又被AI热潮重新推到台前的东西:Causal AI。
下周见。
Dr. Lu · 2026年8月
关于作者:Dr. Lu,昆仑数据创始人陆薇。虽然是计算机博士,大部分时间不在机房,而在工厂和去工厂的路上。20年来专注一件事:让数据真正理解工业。她是IEEE TCSVC Woman in Services Computing第一位华人女性获奖者,也是最早参与制定中国工业大数据路线图的那批人之一。这个专栏是她在一线的思考——关于工业AI、关于本体模型和控制论、关于AI在工厂落地那些事儿和人。