课程首页· 术语表· 第 1 课 / 共 5 课

Lesson 01 · 起点

DreamerV3 是什么,为什么方案选它

先把"它属于哪一派"和"为什么 HVAC 非它不可"钉死,后面四课才不乱。

方案文档 world-model-hvac-implementation.md 一上来就摆出一堆名词:MBRL、DreamerV3、RSSM、想象 rollout、Actor-Critic…… 这一课只解决两个问题:DreamerV3 到底是个什么东西,以及为什么我们的暖通智能体选它,而不是 PPO / SAC 这些更常见的强化学习算法。理解了这两点,后面四课都是细节展开。

一句话:先学规则,再在脑中下棋

最直白的类比

学下棋的两种路子

无模型 RL(比如 PPO / SAC)像"只靠实战学棋"——上来就摆棋盘下,输赢见多了,慢慢形成直觉。它学得慢(要下特别多盘),但简单粗暴、稳。

DreamerV3像"先花时间把规则吃透,再在脑子里反复演练各种走法"——它先学一个世界模型("如果我这么走,棋盘会变成什么样"),然后在脑子里推演成千上万局,挑出最好的策略再去实战。学得快(实战少得多),因为它把昂贵的"实战"换成了廉价的"脑补"。

这个差别是整门课的核心。用术语说:DreamerV3 属于 MBRL(Model-Based Reinforcement Learning,基于模型的强化学习)——它显式地学一个环境模型,而 PPO/SAC 属于无模型 RL(不学模型,直接从实战经验里学策略)

它的"出身":Dreamer 谱系

DreamerV3 不是凭空冒出来的,它是 Google DeepMind 的 Danijar Hafner 一条研究线迭代了六年的产物。看懂这条谱系,你就懂它的"成熟度"从哪来:

Dreamer 谱系(调研报告 [§3.3] 整理)
版本年份关键突破
PlaNet2019首次在潜在空间里做规划
DreamerV12020把"在想象里训练 Actor-Critic"这套范式跑通,大幅提速
DreamerV22021离散动作空间,Atari 55 个游戏打到人类水平
DreamerV32023一套固定超参数跨 150+ 任务,无需调参
DreamerV32025登顶学术期刊《Nature》(同行评审里程碑)

它在 Pivot 项目里扮演的角色

这是整门课最重要的一张图。看懂它,你就懂了 DreamerV3 的定位,也复习了 EnergyPlus 课里那张图:

我们的目标:让智能体学会控空调、省电,但真楼不能随便试错
        │
        │  训练环境 = EnergyPlus 仿真(见姊妹课 teaching-energyplus)
        ▼
  ┌──────────────────────────────────────────────────────┐
  │  DreamerV3 训练循环(本课的主题)                          │
  │                                                        │
  │   ① 少量真实试错:智能体在 EnergyPlus 里走几步           │
  │        │   收集 (状态, 动作, 奖励, 下一状态) 经验        │
  │        ▼                                                │
  │   ② 学世界模型:从经验里学会                            │
  │        "给一个状态+动作,楼下一步会变成啥"               │
  │        │   ← 这一步几乎不用再碰真环境                    │
  │        ▼                                                │
  │   ③ 在脑中做梦:用世界模型想象成千上万条未来轨迹         │
  │        │                                                │
  │        ▼                                                │
  │   ④ 在想象里训练策略(Actor-Critic)→ 学会控冷机         │
  └──────────────────────────────────────────────────────┘
        │
        │  学成后,推理服务把策略接进 os-server(第 5 课)
        ▼

关键区别在第 ②③④ 步:大部分"学习"发生在世界模型里,不是在昂贵的 EnergyPlus 仿真里。这就是 MBRL 比 PPO/SAC"省样本"的根源——后面三课会拆开讲。

为什么是 DreamerV3,而不是 PPO / SAC

这是新人最自然的疑问——PPO、SAC 名气更大、用得更多,为什么暖通要挑一个相对小众的 MBRL?方案 §2.1 的选型,背后是 HVAC 场景的几个硬特点:

HVAC 场景特点 → 为什么 MBRL 更合适(调研报告 [§3.3.3] / [§6.5])
HVAC 特点对无模型 RL(PPO/SAC)对 DreamerV3(MBRL)
仿真一步很慢
(EnergyPlus 一步要算热平衡)
致命弱点:要几百万步才收敛,仿真跑不起 优势:真环境只走少量步,其余在模型里"做梦",省样本
热惯性大、有规律
(室温变化慢、可预测)
浪费:明明有规律可学,却不去学 优势:世界模型正好把"热动力学规律"学下来
需要前瞻
(现在多制冷,是为压住 2 小时后的峰值)
只能反应式:看到热了才加大冷机 优势:想象 rollout 天然支持"往前算 N 步"的前瞻规划
每栋楼都不同
(要快速复制到新楼)
每栋楼都要重新海量试错 优势:世界模型从数据学,纯数据驱动、易迁移(调研 [§3.3.3])
这一课的小收获

DreamerV3 是 DeepMind 的 Hafner 谱系的基于模型强化学习算法(MBRL),核心是先学一个世界模型,再在模型里"做梦"训练策略。它和 PPO/SAC 的本质区别是"显式学模型 vs 不学模型"。HVAC 选它,是因为仿真慢、有热惯性规律、需要前瞻、要复制到多栋楼——这四点恰好是 MBRL 的主场。但要记住:商用无标杆,必须先仿真验证。

自测一下

DreamerV3 和 PPO/SAC 最本质的区别是?

卡住了就问我:"世界模型"这个词如果让你犯晕,正常——它既指算法学到的那个"模型",又是一种流派名。可以问我"方案里说的世界模型,到底是指一段代码、还是一个数学函数",我会用 EnergyPlus 课里的"物理沙盘"类比接住你。

参考来源 DreamerV3 论文(arXiv:2301.04104) · DreamerV3 项目页(作者) · 调研报告 §3.3(Dreamer 谱系)/ §3.3.3(HVAC 映射) · 方案文档 §2.1