课程首页· 术语表· 第 4 课 / 共 7 课

Lesson 04 · 全景

五大流派

把乱哄哄的"世界模型圈"看成五所学校,就清楚了。

你大概已经发现:"世界模型"这个词被很多人抢着用,但说的根本不是一回事。有人指 Sora 那种生成视频的,有人指 Dreamer 那种做控制的,还有人指机器人用的。

别晕。其实大家只是在用不同的方法做"预测、想象、决策"这三件事。我们把这些方法分成五所学校。看懂这五所学校的脾气,你就能在新闻里一眼认出"这是哪一派"。

先看一张总表

五所世界模型学校
学校脾气(一句话)代表爱用在
① 演练派学规律,在脑中下棋DreamerV3空调节能
② 抽象派不画像素,只猜要点V-JEPA 2安防预警
③ 电影派直接生成下一帧画面Sora、Cosmos(暂非实时控制)
④ 祖师派最早的开山之作Ha & Schmidhuber 2018已被超越
⑤ 机器派给机器人专用的NVIDIA GR00T人形机器人

① 演练派 · Dreamer

MBRL(基于模型的强化学习),代表作 DreamerV3,2025 年登上了顶尖学术期刊《Nature》。

脾气

先摸清规则,再下棋

它不会一上来就瞎试。它会先学懂这个世界的运转规律(比如屋子温度怎么随空调变化),然后在脑中反复演练各种走法,挑最好的去执行。

这派最适合有规律可学、且需要规划的场景——比如空调:建筑热起来慢,正好适合"往前算几步"。

② 抽象派 · JEPA

JEPA(联合嵌入预测架构),LeCun 力推,最新作是 Meta 2025 年的 V-JEPA 2。

脾气

不临摹画面,只猜"要点"

这派最较真:他们认为去预测每一帧像素是浪费时间(容易学到表面纹理,不懂本质)。所以他们只预测"抽象要点"——比如不画下一帧,只猜"接下来是个人在跑、还是车在动"。

这个脾气特别适合安防:正常画面它都能"猜中要点",一旦猜不中、误差变大,就说明出现了"没见过的事"——可能就是异常。

③ 电影派 · 生成式视频

代表作 OpenAI 的 Sora、NVIDIA 的 Cosmos。它们的招牌是直接生成逼真的画面

脾气

会放电影,但未必懂物理

画面好看,但常穿帮:杯子穿过桌子、人手多出几根手指。说明它学到了"画面长什么样",没学到"世界怎么运转"。所以它适合做创意、生成训练素材,但不适合做需要实时决策的控制。

④ 祖师派 · 循环世界模型

2018 年 Ha & Schmidhuber 的《World Models》论文,第一次系统提出"在脑中做梦 + 训练"的范式。所有后辈都受它启发。

但它用的老办法(细节上较弱)已被 Dreamer 等超越。作为概念理解有价值,工程上直接用新派即可。

⑤ 机器派 · 具身智能

机器人用的世界模型,代表是 NVIDIA 2025 年的 GR00T。它要解决的是机器人怎么走路、怎么抓东西这类问题。

和前四派关系不大,属于另一个赛场。除非你关心机器人,否则可以先不管它。

一张图看清五派关系

              世界模型的"五所学校"

   实时决策型 ──→ ① 演练派 (Dreamer)   ── 空调节能
                 ② 抽象派 (JEPA)       ── 安防预警
                          ↑
                  这两派是当下主流,
                  也是本课程重点

   内容生成型 ──→ ③ 电影派 (Sora/Cosmos) ── 做素材、做创意

   历史奠基  ──→ ④ 祖师派 (Ha&Schmidhuber) ── 已被超越

   另一赛场  ──→ ⑤ 机器派 (GR00T)       ── 机器人专用
本课收获

世界模型圈看着乱,其实就是五所学校。最该记住的是前两所:演练派(Dreamer)管空调、抽象派(JEPA)管安防。这两派技术栈完全不同,所以不存在"一个世界模型包打天下"。

小测一下

"坚决不预测像素,只预测抽象要点"是哪一派的脾气?

想看看真用场?下一课我们把演练派和抽象派放到三个真实场景里——空调、安防、照明——看它们到底灵不灵。
参考资料: 调研报告 §3(五大流派)、§3.8(对比总结)。 DreamerV3: Nature 2025;V-JEPA 2: arXiv 2506.09985;Sora/Cosmos/GR00T 见报告参考文献。