Lesson 04 · 全景
五大流派
把乱哄哄的"世界模型圈"看成五所学校,就清楚了。
你大概已经发现:"世界模型"这个词被很多人抢着用,但说的根本不是一回事。有人指 Sora 那种生成视频的,有人指 Dreamer 那种做控制的,还有人指机器人用的。
别晕。其实大家只是在用不同的方法做"预测、想象、决策"这三件事。我们把这些方法分成五所学校。看懂这五所学校的脾气,你就能在新闻里一眼认出"这是哪一派"。
先看一张总表
| 学校 | 脾气(一句话) | 代表 | 爱用在 |
|---|---|---|---|
| ① 演练派 | 学规律,在脑中下棋 | DreamerV3 | 空调节能 |
| ② 抽象派 | 不画像素,只猜要点 | V-JEPA 2 | 安防预警 |
| ③ 电影派 | 直接生成下一帧画面 | Sora、Cosmos | (暂非实时控制) |
| ④ 祖师派 | 最早的开山之作 | Ha & Schmidhuber 2018 | 已被超越 |
| ⑤ 机器派 | 给机器人专用的 | NVIDIA GR00T | 人形机器人 |
① 演练派 · Dreamer
MBRL(基于模型的强化学习),代表作 DreamerV3,2025 年登上了顶尖学术期刊《Nature》。
先摸清规则,再下棋
它不会一上来就瞎试。它会先学懂这个世界的运转规律(比如屋子温度怎么随空调变化),然后在脑中反复演练各种走法,挑最好的去执行。
这派最适合有规律可学、且需要规划的场景——比如空调:建筑热起来慢,正好适合"往前算几步"。
② 抽象派 · JEPA
JEPA(联合嵌入预测架构),LeCun 力推,最新作是 Meta 2025 年的 V-JEPA 2。
不临摹画面,只猜"要点"
这派最较真:他们认为去预测每一帧像素是浪费时间(容易学到表面纹理,不懂本质)。所以他们只预测"抽象要点"——比如不画下一帧,只猜"接下来是个人在跑、还是车在动"。
这个脾气特别适合安防:正常画面它都能"猜中要点",一旦猜不中、误差变大,就说明出现了"没见过的事"——可能就是异常。
③ 电影派 · 生成式视频
代表作 OpenAI 的 Sora、NVIDIA 的 Cosmos。它们的招牌是直接生成逼真的画面。
会放电影,但未必懂物理
画面好看,但常穿帮:杯子穿过桌子、人手多出几根手指。说明它学到了"画面长什么样",没学到"世界怎么运转"。所以它适合做创意、生成训练素材,但不适合做需要实时决策的控制。
④ 祖师派 · 循环世界模型
2018 年 Ha & Schmidhuber 的《World Models》论文,第一次系统提出"在脑中做梦 + 训练"的范式。所有后辈都受它启发。
但它用的老办法(细节上较弱)已被 Dreamer 等超越。作为概念理解有价值,工程上直接用新派即可。
⑤ 机器派 · 具身智能
给机器人用的世界模型,代表是 NVIDIA 2025 年的 GR00T。它要解决的是机器人怎么走路、怎么抓东西这类问题。
和前四派关系不大,属于另一个赛场。除非你关心机器人,否则可以先不管它。
一张图看清五派关系
世界模型的"五所学校"
实时决策型 ──→ ① 演练派 (Dreamer) ── 空调节能
② 抽象派 (JEPA) ── 安防预警
↑
这两派是当下主流,
也是本课程重点
内容生成型 ──→ ③ 电影派 (Sora/Cosmos) ── 做素材、做创意
历史奠基 ──→ ④ 祖师派 (Ha&Schmidhuber) ── 已被超越
另一赛场 ──→ ⑤ 机器派 (GR00T) ── 机器人专用
世界模型圈看着乱,其实就是五所学校。最该记住的是前两所:演练派(Dreamer)管空调、抽象派(JEPA)管安防。这两派技术栈完全不同,所以不存在"一个世界模型包打天下"。
"坚决不预测像素,只预测抽象要点"是哪一派的脾气?
没错。JEPA(抽象派)的核心信条就是"别在像素上浪费力气,只猜要点"。 也正因如此,它适合安防——猜不中要点的地方,往往就是异常。