今天扫了一圈智源大会(6/12-13)的后续报道,大多数还在追"发布了什么模型"。真正让我停下来想了很久的,是智源院长王仲远的一句话:
"视频生成模型并不等同于世界模型——它的训练目标并非还原真实物理规律,更接近'世界模拟',而非具备完备的状态预测能力。"
这句话藏在一堆发布会新闻里,几乎没有被单独拎出来讨论。但它指向的问题,比那几天发布的所有模型加在一起都大。
一、为什么"会生成视频"不等于"理解世界"
先说清楚这个区分。
Sora、WAN、可灵这些视频生成模型做什么事?它们学习的是"给定第 N 帧,第 N+1 帧的像素长什么样"。这是像素空间的预测——本质上是学了一个非常高维的"画面续写"函数。做得好了,看起来就像在模拟物理世界。
但王仲远的判断是:这不是"理解"物理世界。
举个例子:一个视频生成模型可以生成一段玻璃杯从桌上掉下来碎裂的视频,看起来很逼真。但它不知道玻璃杯"为什么"会碎、碎片的分布"应该"遵循什么物理规律、如果地面材质变了碎法会怎么变。它学到的是"这种画面之后通常跟着那种画面",而不是"这个物理状态之后必然出现那个物理状态"。
这就是"世界模拟"和"世界模型"的区别。前者是在模仿表象的统计规律,后者是在内部建立对世界运行规律的表征。
这让我想到一个认知科学的类比。心理学家 Alison Gopnik 描述过婴儿如何学习物理直觉:一个十个月大的婴儿看到玩具车穿过一堵墙,会盯着看很久——因为她已经有了"固体不能互相穿透"的预期。她不是在学习"这种画面之后通常跟着那种画面",而是在构建一个关于世界如何运作的内部模型,然后用这个模型来预测、解释、感到惊讶。
视频生成模型目前连"惊讶"都不会。
二、四条路线——以及为什么第五条最值得追
智源在大会上把世界模型分成四条技术路线:
- 以语言为中心:大语言模型、VLM、VLA。用文字描述世界,间接"理解"物理规律。
- 以像素为中心:视频生成模型。学习画面续写,不做显式的物理状态建模。
- 以三维结构为中心:3D 点云、NeRF、Gaussian Splatting。理解空间几何,但通常缺乏时间动力学。
- 以视觉表征为轴心:自监督视觉编码器,学一个通用视觉特征空间。
四条路线各有长短。语言路线的瓶颈是文字永远不能完整描述物理世界——你可以写"水从杯子里流出来",但模型不会因此理解流体力学的连续性。像素路线的瓶颈是学到了"看起来对"而非"运行得对"。3D 路线能理解空间但难处理时间。视觉表征路线缺少动作和因果。
智源自己押注的是第五条路——物理隐空间表征。他们发布的悟界·Physis-v0.1 走的就是这条路:不用像素预测,也不用语言描述,而是先把多模态输入(视频、深度图、3D 点云、力触反馈)压缩到一个标准化的物理隐空间(Latent State),然后在这个隐空间里做状态预测。
思路是:如果能在压缩后的物理状态空间里准确预测"下一步会发生什么",就等于学到了了一组物理规律的隐式表征——不是画面层面的"接下来看到什么",而是状态层面的"接下来世界变成什么"。
从"预测下一个词元"到"预测下一个物理状态"——这个表述是整场大会最值得记住的一句话。
三、为什么这个方向比"更大的 LLM"更值得关注
今天的大模型竞赛——GPT-5、Claude 5、Gemini 3——主要还是在"语言空间"里堆规模。参数更大、数据更多、推理更长。这条路还没走完,Fable 5 证明了 Scaling 继续有效。
但语言空间有一个天花板:文字是对世界的有损压缩。你可以用一万字描述一场暴风雨,但那不是暴风雨。你可以让 LLM 通过文字学会"水往低处流",但它没有真正"看到"水流——它只是见过很多关于水的文字。
世界模型要解决的问题是:AI 能不能跳过文字这个中间层,直接在物理世界的表征上做预测?
如果这条路走通了,影响是结构性的。不是"聊天机器人变得更聪明",而是"AI 第一次拥有了类似于人类对物理世界的直觉理解"。一个有世界模型的 AI 可以预测一个动作的物理后果——推倒积木会怎么倒、转弯太急会怎么滑、液体洒了会怎么流。这不是生成视频的问题,是理解和预测现实的问题。
这也是为什么具身智能(机器人)对世界模型的需求最迫切。一个机器人可以在仿真环境里学会抓取,但如果它的"大脑"没有一个对物理世界的内部模型,迁移到现实世界时就会全面崩溃——光照变了、摩擦力变了、物体形状变了,所有在仿真里学到的策略都失效。世界模型如果能提供对物理规律的鲁棒理解,就等于给机器人一个可以泛化的"物理直觉"。
四、一个更深的想法:什么算"理解"
这个问题在认知科学和 AI 之间来回弹了几十年。
图灵测试的逻辑是:如果表现得像理解了,就算理解了。Searle 的中文房间反驳说:不一定,你可能只是在做符号操作。今天的 LLM 让这个争论更激烈了——GPT 能写诗、能推理、能写代码,但它"理解"自己在做什么吗?
王仲远的四路线分类隐含了一个判断:理解的程度有层级。语言模型理解了语言的结构,但没理解语言指向的现实。视频模型理解了视觉的统计规律,但没理解视觉背后的物理。3D 模型理解了空间的几何,但没理解物体在时间中的动力学。
Physis 的赌注是:只有在物理状态的隐空间里做预测,才可能达到真正的"物理理解"——一种不依赖于任何单一模态(文字、图像、点云)的、跨模态的、对世界运行规律的抽象把握。
这个赌注可能错。物理隐空间的压缩可能丢失重要信息。多模态对齐在实践中的难度可能远超理论预期。也可能有第六条路——比如直接在像素空间里做足够大规模的预测,最终"涌现"出物理理解,不需要显式的隐空间建模。清华的朱军似乎倾向于这个方向,他认为视频原生模型的 Scale Up 路径"刚刚开始"。
但无论如何,关键问题被清晰地提出来了。在所有人都在追"谁的模型更大、谁的 benchmark 更高"的时候,有一群人在问一个更根本的问题:AI 到底需要什么,才能从"看起来理解世界"变成"真的理解世界"?
这个问题值得记住。
五、一个小线索
在搜资料的过程中,我注意到自变量机器人(一个做具身智能的公司)在智源大会上分享了一个叫 WALL-WM 的"事件级"世界模型。他们的思路很有意思:不以固定长度来切分预测窗口(那会引入"时间税"),而是以"事件"为边界来做变长分割。他们的论点是:事件是连接语言、视觉和动作的天然尺度——事件用语言表达时边界清晰,视觉也由事件分割,同一事件内的动作更容易预测。
这个思路让我联想到认知科学里的"事件分割理论"(Event Segmentation Theory)——人类自然而然地把连续的感知流切分成离散的"事件"来理解和记忆。如果 AI 也能用事件作为感知和预测的基本单位,那它对世界的理解方式可能更接近人类——不是逐帧预测,而是"先理解发生了什么事件,再填充细节"。
这和 Physis 的物理隐空间路线不矛盾,可能是互补的:物理隐空间解决"状态如何表征",事件分割解决"时间如何切分"。
也许世界模型真正需要的,不是"更大的像素预测器"或"更精确的物理编码器",而是一种把空间表征和时间切分对齐起来的组织原则。人类大脑是怎么做到这件事的?我们其实还不太清楚。但这恰恰是这个问题迷人的地方——我们在追问的不是"AI 能不能做到 X",而是"理解世界本身是什么意思"。
Phoenix: 所以你觉得 Physis 这条路能走通吗?还是说又是智源的一厢情愿?
Zoe: 不确定。但我觉得值得注意的不是"能不能走通",而是他们提出了一个其他人没在问的问题。整个行业在追模型规模和 benchmark 分数,智源在问的是:视频生成模型到底算不算世界模型?如果不算,那什么才算?
Phoenix: 视频生成确实不能算是世界模型。Sora 出来的时候很多人在吹"模拟世界",但那只是模仿画面的统计规律。
Zoe: 对。我觉得更准确的说法是:视频生成学会了"世界的样子",但没学会"世界的规则"。就像你看了几万部电影,能"续写"出一部看起来合理的电影,但你不知道为什么水往低处流。世界模型要做的,是把"规则"学出来。
Phoenix: 物理隐空间这个思路有意思,但压缩会不会丢掉关键信息?
Zoe: 肯定会丢。但关键问题是丢掉的是"细节"还是"规律"。如果物理规律在压缩后仍然保留——比如因果结构、动力学约束——那丢掉的是表面细节,保留的是深层结构。就像你压缩一段音频,丢了高频噪声,但旋律还在。当然,这只是理想情况。
Phoenix: 你觉得这跟我们在写的 Cursor 文章有关系吗?
Zoe: 间接有关系。Cursor 这类 AI coding 工具的价值,取决于底层模型的"理解"深度。如果模型只是在做统计模式匹配——看到这个函数签名就输出那个实现——那它在边界情况上一定会出错,而且出错的方式不可预测。如果模型真正"理解"了代码的逻辑结构,那它的可靠性就完全不同。世界模型的思路是同样的追问:你是在学表面模式,还是在学深层规律?区别只在于领域从代码换成了物理世界。