课程首页· 术语表· 第 2 课 / 共 7 课

Lesson 02 · 分界线

它和现在的 AI 有什么不同?

一句话分辨"会说话的 AI"和"懂世界的 AI"。

你已经知道世界模型是"能预测未来的模拟器"。但这年头什么东西都往 AI 上靠,新闻里一会儿说 Sora 是世界模型,一会儿又说 ChatGPT 懂世界。到底怎么分?这一课给你一把快刀

判断标准:问它两个问题

遇到任何号称"智能"的东西,在心里问它两个问题:

两个试金石问题
问题会说话/画图的 AI世界模型
① 它懂"动作"吗?
"如果我做了某事……"
不懂
② 它能"决定怎么做"吗?
挑出最好的一步去执行
不能

两个都答"能",才算真正意义上的世界模型。只答对一个、或都答不上来的,充其量是"很会模仿的 AI"。

一个画面

背剧本 vs. 懂规则

会说话/画图的 AI,像一个把千万部电影的台词背得滚瓜烂熟的人。你问什么,它能接上一段很像样的对白。但你真让它上台即兴演一段没排练过的戏,他会卡壳——因为他背的是台词,不是"戏的规律"。

世界模型,更像一个真懂表演规则的演员:哪怕遇到没见过的剧情,也能推演"如果我这样演,对手会怎么接、观众会怎么感受",从而临场做决定。

常见的"近亲",别混淆

① 它和"数字孪生"是一回事吗?

不是,但是亲戚。

数字孪生世界模型
是什么现实物体的"数字镜像"环境规律的"模拟器"
会不会算未来大多只是展示 + 实时数据会推演未来
一句话静态的"照片"会算命的"照片"

你可以这样记:数字孪生是"看",世界模型是"看 + 算 + 决定"。世界模型是数字孪生的升级版。

② Sora 算世界模型吗?

按我们的试金石:Sora 不懂"动作",也不能据此做决定。所以严格说,它是很像世界模型的视频生成器,但还不是完整的世界模型。这是目前最大的争议之一(第 7 课会细聊)。

③ ChatGPT 算吗?

不算。它极度擅长接话和组合知识,但它本质上是在预测"下一个字",并不在脑中模拟一个会变化的世界。LeCun 有句很出名的话:

"大语言模型离真正的智能还差得远,因为它们没有物理世界的直觉。"

— Yann LeCun
本课收获

记住两个试金石问题:它懂"动作"吗?它能"决定怎么做"吗?

以后看到任何"XX 是世界模型"的新闻,拿这两个问题一筛,真假自现。

小测一下

有人说"我们公司的监控大屏就是世界模型"。最准的反驳是?

想再聊聊?可以问老师:"那世界模型到底是怎么'算未来'的?它脑子里装的是什么?"——这正是第 3 课的主题。
参考资料: LeCun (2022);OpenAI《Video Generation Models as World Simulators》(2024); 调研报告 §3.4–§3.5(JEPA vs 生成式视频之争)。