课程首页· 一页速查· 术语表

参考 · Reference

术语表

每个词配一句工程语言翻译。背不下来没关系,回这里查就行。

ABCD EGHI KLMO PRST
动作 / Action a_t
智能体对环境做的事——HVAC 里就是冷机功率、水泵频率、AHU 风量、阀门开度等控制量。DreamerV3 内部要求动作落在 [-1,1],由 envs/hvac.py_denormalize 还原成真实量纲。 方案 §2.1.4 里 action_space = Box(shape=(8,))。
Actor-Critic 演员-评论家
两个网络分工:Actor(策略)给状态出动作;Critic(价值函数)估"从此状态出发的长期累积奖励",给 Actor 打分指方向。DreamerV3 在想象轨迹上训练它俩。部署时只用 Actor。 方案 §6.2.4 把 Actor 映射成"控制策略"、Critic 映射成"价值评估"。
Critic 价值函数 / 评论家
见 Actor-Critic。训练时的"陪练",上线后不需要。
discount / 折扣因子 γ
未来奖励的打折程度(0~1)。越小越看重近期奖励。HVAC 能耗即时性强,方案从默认 0.997 微调到 0.99。 和 imag_horizon 一样,属"物理时间尺度"类超参,按场景调。
dreamerv3-torch NM512/dreamerv3-torch
DreamerV3 的社区 PyTorch 复现,方案 §2.1.1 所选(commit 6ef8646)。2026-07-05 已归档,作者指向继任仓库 r2dreamer。 PoC 仍建议用它(与方案代码骨架一一对应、可复现);长期演进再迁 r2dreamer。
Encoder / 编码器 编码器
RSSM 四零件之一。把一堆传感器读数压缩成紧凑的潜在状态。见 Decoder(它是逆操作,约束编码不丢信息)。
Gymnasium 原 OpenAI Gym
RL 环境的通用 Python 接口(reset() / step() + 观测/动作空间)。DreamerV3 只认这个接口;envs/hvac.py 就是实现它、背后接 Sinergym→EnergyPlus。 见第 4 课。
隐状态 / hidden state RSSM 状态
RSSM 对"近期历史"的压缩——Actor 的"记忆"。推理时每来一次新读数就更新它,再基于它出动作。每栋楼独立一个,不能跨楼串;回退 PID 时要清掉。 这是方案 §2.3.3 推理服务 _agent_state 字典存的东西。见第 5 课。
想象 rollout imagination rollout
用世界模型(先验)从真实状态出发纯靠想象前推 N 步,生成一条训练轨迹。N = imag_horizon。几乎不碰真环境,是省样本的核心。 见第 3 课。
imag_horizon / 想象步数 想象前推步数
每次想象 rollout 往前推几步。HVAC 热惯性大,方案从默认 15 提到 20。太大则模型预测误差累积成噪声。 权衡:"前瞻多远" vs "预测多准"。见第 3 课。
KL 散度约束 KL divergence
训练时让先验(做梦)和后验(现实)尽量一致的约束。不让模型"做梦"和"现实"脱节——这是安全门控监控预测误差的底层原因。
潜在状态 latent state
编码器把原始观测压缩成的几十维紧凑向量(确定性 + 随机性两部分)。所有预测都在它上面做,比在原始读数上做又快又准。 维度由 dyn_deter(512) / dyn_stoch(32) 控制,属"固定超参"。
MBRL 基于模型的强化学习
Model-Based RL。显式学一个世界模型,再在模型上训练策略。DreamerV3 属于它。与"无模型 RL"(PPO/SAC,不学模型)相对。 HVAC 选 MBRL 的四大理由:仿真慢、有规律、要前瞻、要复制。见第 1 课。
观测 / Observation o_t
智能体能看到的楼的状态——室温、水温、CO₂、室外温……一堆传感器读数。方案 §2.1.4 里 observation_space = Dict{'vector': Box(shape=(32,))}。
先验 / 后验 prior / posterior
转移模型的两种用法。先验:做梦时(想象 rollout,无新观测),只凭状态+动作预测。后验:醒来时(有新读数),用观测修正。训练时让两者一致。 见第 2 课。是理解"为什么想象会越推越不准"的钥匙。
RSSM Recurrent State-Space Model
循环状态空间模型——DreamerV3 的世界模型学结构。四零件:Encoder(压缩)/ Transition-先验(预测)/ Decoder(还原约束)/ Reward head(预测奖励)。 方案 §6.2.4 左四行全是它。见第 2 课。
r2dreamer dreamerv3-torch 继任者
dreamerv3-torch 作者声明的新仓库:更新的 PyTorch 复现、号称快约 5×。代码结构与 dreamerv3-torch 不同,方案那段骨架不再一一对应。 PoC 范围内不迁移;长期演进时再评估。
symlog / 离散化 V3 的数值稳定技巧
V3 能"一套超参跨 150+ 任务"的两个数值技巧:symlog(对称对数变换,让大小悬殊的奖励都能学)+ 离散潜在状态(32 个类别)。属"固定超参"的幕后功臣,工程上不用改。
Transition / 转移模型 先验
RSSM 四零件之一。学"给当前状态+动作,下一步状态是什么"。HVAC 里就是建筑热动力学。做梦时用它(先验)。见"先验/后验"。