Lesson 08 · 集成
三支柱拼成端到端闭环
最后一课:把预测、控制、安全缝合成一条流水线,并接上 Pivot 楼宇架构。
前七课你分别造出了三块零件:支柱 A 预测器(Neural ODE + PINN)、支柱 B 控制器(SAC)、支柱 C 安全门控。它们单独都能跑,但 BrainBox 的价值在于三者协同——预测器不只产出数字,它喂给安全门控做前瞻拦截;控制器不只是 RL,它被门控关进笼子;门控不只兜底,它依赖预测器判断"模型还可信吗"。
这一课把它们拼起来,画出端到端数据流,并落到 Pivot 现有架构里——告诉你这套东西在 Pivot 该放哪、怎么接、按什么节奏上线。
一、端到端数据流(一张图说清协同)
传感器/CCTV ──MQTT──→ TimescaleDB(时序存储,已有)
│
┌─────────────┼──────────────────────────────┐
▼ ▼ ▼
┌──────────┐ ┌───────────┐ ┌────────────────┐
│ 数据采集 │ │ 支柱 A │ │ 支柱 B │
│ + 清洗 │ │ Neural ODE│ │ SAC 控制器 │
│ │ │ + PINN │ │ (云端推理) │
│ │ │ 6h 前瞻 │ │ │
└──────────┘ └─────┬─────┘ └────────┬───────┘
│ │
预测温度轨迹 候选控制动作
│ │
└──────────┬───────────────────┘
▼
┌───────────────────────┐
│ 支柱 C · 安全门控 │
│ 1.硬约束(用A的前瞻) │
│ 2.限幅 3.回退 4.人工 │
└───────────┬───────────┘
│ 通过/回退
▼
MQTT 下行控制指令(Pivot 现有通道)
│
▼
HVAC 设备
三个协同点(这是"集成"的精华):
- A → C(前瞻拦截):预测器算出候选动作下未来 30min 温度,门控第 1 层据此提前否决越界动作。预测不只是给人看的报表,是安全的眼睛。
- A → C(可信度监控):把上一步预测和当前实测比对,误差连续超阈值 → 门控第 3 层判定"模型不可信",切 PID。模型 drift 不再是隐患。
- B → C(动作驯化):SAC 输出的原始动作,必须经门控限幅+硬约束才下达。RL 的"野性"被驯服成"可上楼的策略"。
二、动手做:把三块缝起来
动手做 8.1 · 端到端推理循环(仿真里跑通)
import gymnasium as gym, sinergym from stable_baselines3 import SAC from torchdiffeq import odeint # 假设你已经有了:forecast_model (支柱A)、sac (支柱B)、SafetyGate (支柱C, 第7课) from safety_gate import SafetyGate from pid import PID sac = SAC.load("./sac_best/best_model") pid = PID() gate = SafetyGate(pid, thermal_model=forecast_model) # 把预测器喂给门控 env = gym.make("Eplus-5zone-hot-continuous-stochastic-v1") obs, prev_obs = env.reset(), None for step in range(3504): # 一年 # 支柱 B:SAC 出候选动作 raw_action, _ = sac.predict(obs, deterministic=True) # 支柱 C:安全门控(内部会调支柱 A 做前瞻/可信度) safe_action, reason = gate.safe_action(raw_action, obs, prev_obs) # 下达 prev_obs = obs obs, reward, term, trunc, info = env.step(safe_action) if reason != "rl_ok": log_shield(step, reason) # 记 shield 触发 if term or trunc: obs, _ = env.reset() env.close()
三、落到 Pivot 架构:放哪、怎么接
研究材料 world-model-research.md §9 已经规划了世界模型在 Pivot 的位置。我们这套(BrainBox 式)技术栈落点几乎一致,因为都是"预测 + 控制 + 安全"的增强层,只是控制层是无模型 DRL 而非 MBRL:
| 组件 | Pivot 落点 | 对接现有件 |
|---|---|---|
| 数据采集 | 现有 IoT 管线 | EMQX (MQTT) → TimescaleDB |
| 支柱 A 预测 | AI/算法中台 · 技能库(新增"区域温度预测"技能) | 模型训练/推理服务 |
| 支柱 B 控制 | 暖通智能体的"MBRL/DRL 增强层"(研究材料 §9.2) | 暖通智能体 + PID 回退 |
| 支柱 C 门控 | 安全门控层(研究材料 §9.2/§9.3,已有规划) | MQTT 下行控制通道 |
| 多租户 | 全局预训练 + 租户微调(研究材料 §9.5) | tenant_code 隔离 + 版本管理 |
四、上线节奏(与研究材料 §6.6 / §11 对齐)
阶段 1(6-12月)· 仿真验证 + 数据积累 ├─ EnergyPlus/Sinergym 里跑通三支柱(你已完成!) ├─ 收集 ≥3 月真实 HVAC 时序数据 └─ 退出门槛:仿真节能 < 5% → 不上真楼 阶段 2(12-18月)· 单栋 PoC + 建议模式 ├─ 选 1 栋楼,RL 只"推荐"设定值,人工审批后执行 ├─ 安全门控四层全开 + 全审计 └─ 退出门槛:3 月后节能 < 5% 或 shield 率 > 20% → 回退 PID 阶段 3(18-24月)· 闭环 + 多栋推广 ├─ KPI 达标后转闭环,建立模型版本管理(类 Flyway) └─ 逐步扩展,持续 drift 检测 + 定期重训
五、诚实复盘:你复刻到了什么、还差什么
| BrainBox 能力 | 你的复刻 | 状态 |
|---|---|---|
| 物理信息 Neural ODE 预测 | torchdiffeq + PINN | ✓ 原理与管线打通 |
| 无模型 DRL 设定值控制 | SAC + 奖励工程 | ✓ 仿真闭环 |
| 安全门控部署 | 四层兜底 + 云边协同 | ✓ 可辩护实现 |
| 三支柱协同 | A 喂 C 做前瞻/可信度 | ✓ 端到端跑通 |
| "96% 精度 / 25% 节能" | MAPE 口径对齐、仿真对标 PID | ≈ 口径对齐,非复刻数字 |
| 真实硬件接入 | —— | 未做(留作生产化延伸) |
| 内部超参/数据管线 | —— | 未公开,无法 1:1 |
1. 三支柱的协同点是 A→C(前瞻拦截 + 可信度监控) 和 B→C(动作驯化)——预测器和门控不只各干各的,是闭环的眼睛和笼子。
2. 落 Pivot:作为暖通智能体的增强层,接现有 IoT/中台/下行通道,不替换既有控制。
3. 上线三阶段:仿真验证 → 单栋建议模式 → 闭环推广,与研究材料 §6.6/§11 对齐。
4. 你复刻的是方法和管线,对标 KPI 而非复制数字。从仿真到 14,000 栋楼的工程差距,诚实标注。
在这套端到端闭环里,支柱 A 的预测模型除了产出温度预报给运营看,还在哪个环节真正参与控制决策?
对了。这是"集成"的精华:预测器是安全门控的眼睛。它在动作下达前前瞻 30min 看会不会越界(第 1 层),并实时比对上一步预测与当前实测判断模型可信度(第 3 层回退触发条件)。把预测只当报表看,就浪费了它一半价值。预测不替代 SAC 决策——决策是无模型 DRL 的事(事实核查定调)。
- Pivot 架构与衔接:world-model-research.md §9(架构建议)/ §6.6(落地路径)/ §11(路线图)
- 研究材料 §9.5 多租户模型策略
- 事实核查(技术路线定调):world-model-brainbox-factcheck.md
- BrainBox 部署模式:lifting-the-veil-on-brainbox-ais-data-architecture