课程首页· 术语表· 第 3 课 / 共 7 课

Lesson 03 · 内部机制

预测、想象、决策

世界模型脑子里到底在干什么?三个动作而已。

上一课我们说,世界模型是"会算未来的模拟器"。这一课,我们把这台模拟器拆开,看看它内部只有三个动作。记住这三个,你就抓住了世界模型的全部核心——后面所有的复杂流派,都只是这三个动作的不同"做派"。

动作一:预测 (猜:接下来会怎样)

这是地基。世界模型最基本的能力,就是根据现在,猜出接下来几步会发生什么

画面

老司机看路况

有经验的老司机,看到前面那辆车稍稍往左偏了一点,心里立刻"预测":它八成要变道。他没看见转向灯,但他脑中的"路况模型"告诉他:这个偏移,接下来大概率是变道。

世界模型干的就是这件事,只不过它预测的对象,可能是一段视频的下一秒,也可能是一间屋子 10 分钟后的温度

动作二:想象 (演练:如果我这么做会怎样)

预测是"被动地看未来"。想象更进一步:主动假设"如果我做某个动作",再看未来会怎样

想象 = 在脑中开好几个"平行宇宙":

  现在状态:屋里 28℃,下午 3 点
      │
      ├── 假设 A:冷机开到 100% → 想象未来 → 1 小时后 23℃,耗电多
      ├── 假设 B:冷机开到  60% → 想象未来 → 1 小时后 25℃,耗电少
      └── 假设 C:冷机开到  30% → 想象未来 → 1 小时后 27℃,太热

  → 哪个未来最想要?这就接到了动作三……

注意:这一切都发生在脑子里,现实中的空调根本没动。世界模型在"脑内平行宇宙"里把各种选项都试了一遍——所以这个动作也叫"演练"。

动作三:决策 (挑:选最好的一步去执行)

想象完多个未来之后,挑出"最想要的那个未来"对应的动作,真正去执行

在上面例子里,如果目标是"省电 + 不让人喊热",那么"假设 B(60%)"看起来最划算——于是世界模型下令:把冷机调到 60%。

预测 → 想象 → 决策。三步一气呵成,这就是一个世界模型"思考"的完整回路。

那它脑子里装的"世界"长什么样?

这里有一个常被忽略、却很关键的设计:世界模型并不在脑子里完整地复制现实。那样太累、也太慢。

画面

你不记车牌,只记"白色越野车"

你回忆朋友的车,不会记下每一颗螺丝、每一道划痕。你只记"白色、越野、挺大"。这就是抽象——丢掉无关细节,只留有用的要点。

世界模型也一样:它把摄像头画面、传感器读数,压缩成一套"要点"(学界叫潜在空间(latent space)),然后在这套要点上做预测、想象、决策。

把三个动作串起来看

          ┌─────────── 世界模型的脑子 ───────────┐
          │                                       │
看见现在 ─→│  ① 预测:接下来会怎样                 │
          │       ↓                               │
          │  ② 想象:如果我做 A/B/C,分别会怎样    │
          │       ↓                               │
          │  ③ 决策:挑最想要的那个,下令执行      │
          │       ↓                               │
          └───────────────────────────────────────┘
                          ↓
                    真正去动空调/刹车/设备
本课收获

世界模型脑子里只做三件事:预测、想象、决策

而且它在"压缩过的要点"上做这些事,而不是死磕每一帧画面——这是它高效、也是它分派别的关键。

小测一下

世界模型"在脑中把几个选项都试一遍"的这一步,叫什么?

好奇了?可以问老师:"既然有'在要点上预测'和'在画面上预测'两种做法,谁更厉害?"——这正是下一课"五大流派"要回答的。
参考资料: Dreamer 系列(Hafner et al.)与 JEPA 系列(LeCun et al.)的预测-想象-规划回路; 调研报告 §3.1、§3.3、§3.4