Lesson 03 · 内部机制
预测、想象、决策
世界模型脑子里到底在干什么?三个动作而已。
上一课我们说,世界模型是"会算未来的模拟器"。这一课,我们把这台模拟器拆开,看看它内部只有三个动作。记住这三个,你就抓住了世界模型的全部核心——后面所有的复杂流派,都只是这三个动作的不同"做派"。
动作一:预测 (猜:接下来会怎样)
这是地基。世界模型最基本的能力,就是根据现在,猜出接下来几步会发生什么。
老司机看路况
有经验的老司机,看到前面那辆车稍稍往左偏了一点,心里立刻"预测":它八成要变道。他没看见转向灯,但他脑中的"路况模型"告诉他:这个偏移,接下来大概率是变道。
世界模型干的就是这件事,只不过它预测的对象,可能是一段视频的下一秒,也可能是一间屋子 10 分钟后的温度。
动作二:想象 (演练:如果我这么做会怎样)
预测是"被动地看未来"。想象更进一步:主动假设"如果我做某个动作",再看未来会怎样。
想象 = 在脑中开好几个"平行宇宙":
现在状态:屋里 28℃,下午 3 点
│
├── 假设 A:冷机开到 100% → 想象未来 → 1 小时后 23℃,耗电多
├── 假设 B:冷机开到 60% → 想象未来 → 1 小时后 25℃,耗电少
└── 假设 C:冷机开到 30% → 想象未来 → 1 小时后 27℃,太热
→ 哪个未来最想要?这就接到了动作三……
注意:这一切都发生在脑子里,现实中的空调根本没动。世界模型在"脑内平行宇宙"里把各种选项都试了一遍——所以这个动作也叫"演练"。
动作三:决策 (挑:选最好的一步去执行)
想象完多个未来之后,挑出"最想要的那个未来"对应的动作,真正去执行。
在上面例子里,如果目标是"省电 + 不让人喊热",那么"假设 B(60%)"看起来最划算——于是世界模型下令:把冷机调到 60%。
预测 → 想象 → 决策。三步一气呵成,这就是一个世界模型"思考"的完整回路。
那它脑子里装的"世界"长什么样?
这里有一个常被忽略、却很关键的设计:世界模型并不在脑子里完整地复制现实。那样太累、也太慢。
你不记车牌,只记"白色越野车"
你回忆朋友的车,不会记下每一颗螺丝、每一道划痕。你只记"白色、越野、挺大"。这就是抽象——丢掉无关细节,只留有用的要点。
世界模型也一样:它把摄像头画面、传感器读数,压缩成一套"要点"(学界叫潜在空间(latent space)),然后在这套要点上做预测、想象、决策。
把三个动作串起来看
┌─────────── 世界模型的脑子 ───────────┐
│ │
看见现在 ─→│ ① 预测:接下来会怎样 │
│ ↓ │
│ ② 想象:如果我做 A/B/C,分别会怎样 │
│ ↓ │
│ ③ 决策:挑最想要的那个,下令执行 │
│ ↓ │
└───────────────────────────────────────┘
↓
真正去动空调/刹车/设备
世界模型脑子里只做三件事:预测、想象、决策。
而且它在"压缩过的要点"上做这些事,而不是死磕每一帧画面——这是它高效、也是它分派别的关键。
世界模型"在脑中把几个选项都试一遍"的这一步,叫什么?
对了!"想象"就是主动假设"如果我做某动作",在脑中演练多个未来。 "预测"是被动看未来,"决策"才是最后拍板执行。