← 返回知识库

综述:世界模型

本文内容来自影视飓风 《在AI里抛硬币,概率是50%吗?》 的整理与延伸。

一、在AI里抛硬币

生成一张AI硬币的图片,正面是数字、背面是花纹,一切都很真实。但如果我现在把这枚AI硬币投出来——正面朝上的概率是多少?

现实世界里你会毫不犹豫地说约50%。但在AI里呢?

影视飓风真的在各种AI模型里扔了几百次硬币。完全一样的提示词,某模型大约70%概率得到正面(数字那一面)。其他模型也各有偏差,但没有一个是50%。

AI生成有选择性,概率不对等。提示词是随机的,人点击也是随机的,但结果差得很远。

二、两个根本弊端

第一个弊端:AI骗不了物理定律。

生成式AI在海量训练集中见识过无数人类抛硬币的画面,提取了其中的规律。但这个规律不是真实世界的物理规律,而是它自己”悟”出来的视觉模式——有点像一张精心伪造的驾照,看着真,一查系统就露馅。

AI对规律的理解完全依赖人类喂给它的数据。而在电影、广告和日常分享中,把硬币清晰正面作为结果来展示的镜头,远高于反面。这就是数据偏见——上游歪了一度,下游偏了百公里。

第二个弊端:算力消耗巨大。

Sora 2这个曾经轰动一时的视频生成模型,每产出10秒钟左右的视频,服务器大约需要蒸发消耗4升淡水、整整一度电。高质量视频生成对AI的消耗非常大,且质量不保证。

这两个问题的根源是同一个:当前的生成式AI并不真正”理解”物理世界,它只是在模拟像素分布。

三、世界模型:观察→预测→执行

解法是一种叫**世界模型(World Model)**的东西。

所谓世界模型,本质上是一个可以预测”当我采取一个行动后,世界会发生什么变化”的模型。它的运作逻辑跟人类直觉非常接近:

  1. 观察世界——这是一枚硬币,大致重量如何,正面反面是否均等,手在什么位置开始抛,落在什么材质上
  2. 预测走向——它会预言接下来无数种物理走向
  3. 判断执行——基于想象出来的未来,判断行动带来的结果,再去执行

这和传统的视频生成模型有本质区别。传统模型是在学”画面长什么样”,世界模型是在学”世界怎么运转”。影视飓风做了一个演示:一句话生成了一座中世纪堡垒,大理石地板、电影级光效、蒸汽朋克风格的物体散布其中。但关键在于——这不是一段只能被动观看的视频,而是一个三维的真实物理世界。借助渲染器,你可以在里面转圈、俯冲,甚至和世界交互。

以前需要花几个星期才能建模出来的场景,现在只要一次算力就能得到。虽然目前看起来还比较粗糙,但已经初步具备了模拟三维物理世界的能力。

四、谷歌Omni:修正能力的突破

2026年5月,Google发布了融合世界知识的视频生成模型Omni。它的物理模拟更真实,生成的人物几乎看不出AI感。

但真正让人震撼的是它的修正能力。讲话的背景可以变成这样,摸的桌子可以变成这样,手上握的东西可以变成这样——而且哪怕你握着的是流体、是透明的物体,它都可以很好地映射。这在以前的模型里几乎没见过。

Omni的官方定位是一个学习了力学、数学乃至世界历史的多模态模型。它已经非常接近我们对物理世界的认知了。但从根本上说,它仍然是在生成二维视频。

五、迈向四维:当我们能在视频里自由走动

如果说在二维视频里能随意运镜、或者三维世界模型能达到写实级别,那做AI视频的几乎所有痛点就都能解决了。

影视飓风最近做了一个接近这个概念的实际案例:用4D高斯泼溅技术,拍摄了一部35分钟的VR短片。由250台相机拍摄真实演员和场景,再通过计算机训练重建出来。

虽然制作过程本身并不简单(250台相机阵列、真实拍摄、计算重建),但这个案例让我们提前看到了未来世界模型成熟后的影像形态——你可以在空间里走到任何一个角度,去观察这个虚拟世界发生了什么。你可以看着前面的角色,也可以走开去端详角落里的细节。

如果以后一句话就能生成这样的四维动态世界,我们创作内容的方式、观看视频的方式,都会发生根本性的改变。

六、不止是视频:游戏与机器人训练

世界模型的价值远超视频生成。

如果把一个机器人丢进世界模型生成的仿真空间,它可以在这个虚拟世界里无限次打翻杯子、无限次摔倒重来。这个仿真环境就是现实世界的载体——它会学会什么是轻重、什么是高低、什么是远近,四肢能像有肌肉组织的真人一样运动。

游戏领域同理。如果一个世界可以无限生成,那它就是一个无尽的游戏。“一句话生成新关卡”可能只是最早期的应用。

英伟达、英特尔都在疯狂推进NPU与世界模型的概念。未来的AI PC不只是一个生产力工具,而更像你的个人数字世界的模拟器。AI手机、AI眼镜也正在成为万物互联的核心入口——前提是AI能更好地理解我们所处的物理世界。

七、几年后再抛一次硬币

把世界模型和影像技术整合到一起,离我们真的不远了。理论上,几年以后我们再去AI里抛硬币,结果会比现在均匀得多的多。

从”看起来像”到”真正懂”,从模仿像素到理解物理——世界模型正在填平AI与现实之间的那条鸿沟。而这条鸿沟一旦填平,改变的远不止是抛硬币的概率。


感谢影视飓风与天猫3C数码对本内容的支持。