Lesson 01 · 起点
DreamerV3 是什么,为什么方案选它
先把"它属于哪一派"和"为什么 HVAC 非它不可"钉死,后面四课才不乱。
方案文档 world-model-hvac-implementation.md 一上来就摆出一堆名词:MBRL、DreamerV3、RSSM、想象 rollout、Actor-Critic…… 这一课只解决两个问题:DreamerV3 到底是个什么东西,以及为什么我们的暖通智能体选它,而不是 PPO / SAC 这些更常见的强化学习算法。理解了这两点,后面四课都是细节展开。
一句话:先学规则,再在脑中下棋
学下棋的两种路子
无模型 RL(比如 PPO / SAC)像"只靠实战学棋"——上来就摆棋盘下,输赢见多了,慢慢形成直觉。它学得慢(要下特别多盘),但简单粗暴、稳。
DreamerV3像"先花时间把规则吃透,再在脑子里反复演练各种走法"——它先学一个世界模型("如果我这么走,棋盘会变成什么样"),然后在脑子里推演成千上万局,挑出最好的策略再去实战。学得快(实战少得多),因为它把昂贵的"实战"换成了廉价的"脑补"。
这个差别是整门课的核心。用术语说:DreamerV3 属于 MBRL(Model-Based Reinforcement Learning,基于模型的强化学习)——它显式地学一个环境模型,而 PPO/SAC 属于无模型 RL(不学模型,直接从实战经验里学策略)。
它的"出身":Dreamer 谱系
DreamerV3 不是凭空冒出来的,它是 Google DeepMind 的 Danijar Hafner 一条研究线迭代了六年的产物。看懂这条谱系,你就懂它的"成熟度"从哪来:
| 版本 | 年份 | 关键突破 |
|---|---|---|
| PlaNet | 2019 | 首次在潜在空间里做规划 |
| DreamerV1 | 2020 | 把"在想象里训练 Actor-Critic"这套范式跑通,大幅提速 |
| DreamerV2 | 2021 | 离散动作空间,Atari 55 个游戏打到人类水平 |
| DreamerV3 | 2023 | 一套固定超参数跨 150+ 任务,无需调参 |
| DreamerV3 | 2025 | 登顶学术期刊《Nature》(同行评审里程碑) |
它在 Pivot 项目里扮演的角色
这是整门课最重要的一张图。看懂它,你就懂了 DreamerV3 的定位,也复习了 EnergyPlus 课里那张图:
我们的目标:让智能体学会控空调、省电,但真楼不能随便试错
│
│ 训练环境 = EnergyPlus 仿真(见姊妹课 teaching-energyplus)
▼
┌──────────────────────────────────────────────────────┐
│ DreamerV3 训练循环(本课的主题) │
│ │
│ ① 少量真实试错:智能体在 EnergyPlus 里走几步 │
│ │ 收集 (状态, 动作, 奖励, 下一状态) 经验 │
│ ▼ │
│ ② 学世界模型:从经验里学会 │
│ "给一个状态+动作,楼下一步会变成啥" │
│ │ ← 这一步几乎不用再碰真环境 │
│ ▼ │
│ ③ 在脑中做梦:用世界模型想象成千上万条未来轨迹 │
│ │ │
│ ▼ │
│ ④ 在想象里训练策略(Actor-Critic)→ 学会控冷机 │
└──────────────────────────────────────────────────────┘
│
│ 学成后,推理服务把策略接进 os-server(第 5 课)
▼
关键区别在第 ②③④ 步:大部分"学习"发生在世界模型里,不是在昂贵的 EnergyPlus 仿真里。这就是 MBRL 比 PPO/SAC"省样本"的根源——后面三课会拆开讲。
为什么是 DreamerV3,而不是 PPO / SAC
这是新人最自然的疑问——PPO、SAC 名气更大、用得更多,为什么暖通要挑一个相对小众的 MBRL?方案 §2.1 的选型,背后是 HVAC 场景的几个硬特点:
| HVAC 特点 | 对无模型 RL(PPO/SAC) | 对 DreamerV3(MBRL) |
|---|---|---|
| 仿真一步很慢 (EnergyPlus 一步要算热平衡) |
致命弱点:要几百万步才收敛,仿真跑不起 | 优势:真环境只走少量步,其余在模型里"做梦",省样本 |
| 热惯性大、有规律 (室温变化慢、可预测) |
浪费:明明有规律可学,却不去学 | 优势:世界模型正好把"热动力学规律"学下来 |
| 需要前瞻 (现在多制冷,是为压住 2 小时后的峰值) |
只能反应式:看到热了才加大冷机 | 优势:想象 rollout 天然支持"往前算 N 步"的前瞻规划 |
| 每栋楼都不同 (要快速复制到新楼) |
每栋楼都要重新海量试错 | 优势:世界模型从数据学,纯数据驱动、易迁移(调研 [§3.3.3]) |
DreamerV3 是 DeepMind 的 Hafner 谱系的基于模型强化学习算法(MBRL),核心是先学一个世界模型,再在模型里"做梦"训练策略。它和 PPO/SAC 的本质区别是"显式学模型 vs 不学模型"。HVAC 选它,是因为仿真慢、有热惯性规律、需要前瞻、要复制到多栋楼——这四点恰好是 MBRL 的主场。但要记住:商用无标杆,必须先仿真验证。
DreamerV3 和 PPO/SAC 最本质的区别是?
卡住了就问我:"世界模型"这个词如果让你犯晕,正常——它既指算法学到的那个"模型",又是一种流派名。可以问我"方案里说的世界模型,到底是指一段代码、还是一个数学函数",我会用 EnergyPlus 课里的"物理沙盘"类比接住你。