Lesson 01 · 定调
BrainBox AI 的真实技术栈长什么样
复刻之前,先把"要复刻什么"这件事彻底说清楚——它不是世界模型。
研究材料 world-model-research.md 里一度把 BrainBox AI 当成"世界模型 / DreamerV3 商用标杆"。但仓库内的 事实核查文档已经把这条结论推翻了。复刻的第一步,就是以核查后的定调为准——否则你照着 DreamerV3 学,却永远复刻不出 BrainBox。
这一课不长,但它锁死了整门课的方向。读完你会知道:BrainBox 到底用了什么、不用了什么、哪些能复刻、哪些只能"推测着补"。
一、核查结论:BrainBox 不是 MBRL
事实核查的依据是一手来源:BrainBox 官网技术页、三份专利、CTO Jean-Simon Venne 的学术发表、Trane 收购公告。结论是一句话:
最硬的证据来自 CTO 的学术履历。他唯一一篇涉及强化学习的合著论文(eSim 2024)用的是 multi-armed bandit(MAB)——这是强化学习里最明确、最纯粹的 model-free 形式,跟"先学环境模型、再在模型上规划"的 MBRL 路线正好相反。
| 论断 | 核查结果 | 依据 |
|---|---|---|
| "BrainBox 未公开用'世界模型'这个词" | 正确 | 全部一手 + 第三方来源均无此词 |
| "BrainBox 是定制化 MBRL" | 无来源支持 | 专利是"监督式预测 + 规则化调制",无"在学到的模型上规划" |
| "BrainBox 本质是 MBRL / 世界模型" | 作者推断,非事实 | 自述 Neural ODE + DRL;CTO 的 RL 论文是 model-free MAB |
| "BrainBox 是 DreamerV3 路线商用标杆" | 过度引申 | "DreamerV3" 在其全部公开材料中零出现 |
二、BrainBox 自述的三根支柱
既然不是 MBRL,那它到底是什么?把它公开材料里反复出现的描述拼起来,就是三根支柱:
┌─────────────────────────────────────────────────────────────────┐ │ BrainBox AI 暖通栈(自述,非推测) │ │ │ │ 支柱 A · 预测 支柱 B · 控制 支柱 C · 部署 │ │ ───────────── ───────────── ───────────── │ │ 物理信息 Neural 无模型深度 云端 SaaS │ │ ODE + LSTM 强化学习(DRL) + 边缘数据采集 │ │ │ │ 预测每个 zone 优化设定值 硬约束 + 限幅 │ │ 未来 6h 温度/能耗 (冷机/水泵/风量) + PID 回退 + 人工接管 │ │ │ │ 自称 96% 精度 自称 ~25% 节能 让 RL 敢上真楼 │ └─────────────────────────────────────────────────────────────────┘
下面把每根支柱拆到"可复刻"的颗粒度:
支柱 A · 物理信息 Neural ODE + LSTM 预测
BrainBox 技术页原话:"Our models achieve 96% predictive accuracy for each HVAC zone up to 6 hours ahead",并反复强调"integrating physics-based principles with black box deep learning",还点名了 Neural ODE(与 Mila 的 Pierre-Luc Bacon 合作)。这是一套监督式预测任务,不是控制任务。
| BrainBox 自述 | 本课程可复刻的实现 |
|---|---|
| Neural ODE 建模连续热动力学 | torchdiffeq,odeint_adjoint 学 dz/dt = f(z,t) |
| 物理信息混合(physics-informed) | 把建筑热 RC 网络 ODE 当损失项(PINN)正则化 |
| LSTM 做时序预报 | nn.LSTM 多变量输入,6h(24 步 × 15min)前瞻 |
| "少数据、更准" | 物理先验压缩假设空间 → 数据高效的机制来源 |
支柱 B · 无模型深度强化学习控制
专利把控制层描述成"规则化 / 约束化调制";第三方目录(AI for PropTech、AEC Magazine)统一刻画为"DRL tunes HVAC setpoints"。这是设定值优化:不直接控阀门,而是改"目标值"(冷冻水温度设定点、送风温度设定点等),让既有 BMS 去执行。
| BrainBox 自述 / 第三方 | 本课程可复刻的实现 |
|---|---|
| 深度强化学习(DRL) | Stable Baselines3,连续控制首选 SAC |
| 优化 setpoints | Gymnasium 连续动作空间 → 供水/送风温度设定点 |
| 奖励 = 能耗 + 舒适度 + 设备磨损 | 多目标惩罚奖励,权重可调 |
| 约束化调制(专利用词) | 动作限幅 + 安全门控(见支柱 C) |
支柱 C · 安全门控 + 云边部署
这是把 RL 从"论文里"搬到"14,000 栋楼里"的真正难点。BrainBox 部署模式是云端 SaaS + 边缘数据采集,并且一定有安全兜底(否则没法商用)。公开细节有限,但模式是行业共识,本课程给可辩护的四层实现:
RL 控制器输出
│
▼
┌──────────────────────────────────┐
│ 1. 硬约束 温度∈[18,26]°C │ ← 越界直接否决
│ CO₂<1000ppm / 湿度∈[30,70]%
│ 2. 限幅 单步变化 < Δ_max │ ← 防止策略"乱抖"
│ 3. 回退 连续 N 步预测误差>ε │ ← 模型不靠谱时
│ → 切回 PID / 规则 │
│ 4. 人工接管 一键切回手动 │ ← 值班兜底
└──────────────────────────────────┘
│
▼
MQTT 下行控制指令(Pivot 现有通道)
三、可复刻的边界:哪些能做,哪些只能"推测着补"
诚实是这门课的前提。BrainBox 有大量内部细节没公开,无法 1:1 复刻。下表划清边界:
| 类别 | 内容 | 本课程态度 |
|---|---|---|
| 能复刻 | Neural ODE / LSTM 预测、SAC 设定值控制、安全门控四层、EnergyPlus 仿真闭环 | 给完整可跑代码,对齐公开原理 |
| 能对齐 | "96% 预测精度"、"25% 节能"作为目标区间,在仿真里去逼近、去对比 | 当 KPI,不当"复制粘贴的保证" |
| 推测着补 | 内部模型结构、超参、数据管线拓扑、奖励权重具体值 | 明确标注"推测",给可辩护的最小实现 |
| 不碰 | 真实楼宇硬件接入(BACnet/Modbus 下行)、多租户隔离细节 | 留作"生产化延伸",不在主线 |
四、整门课的路线图
接下来 7 课就按这三根支柱 + 一个共同的仿真沙盒推进。建议顺序:
第 2 课 仿真沙盒 EnergyPlus + Sinergym(所有模型的"实验台") │ ├─ 第 3 课 物理基线 热 RC 网络 ODE + 规则/PID(给后面所有方法当对照) │ ├─ 第 4 课 支柱 A Neural ODE 预测区域温度(torchdiffeq) ├─ 第 5 课 支柱 A续 物理信息正则化 + LSTM 对比(PINN) │ ├─ 第 6 课 支柱 B 无模型 DRL 设定值优化(SAC) │ ├─ 第 7 课 支柱 C 安全门控 + 云边部署 │ └─ 第 8 课 集成 三支柱端到端闭环 + 接 Pivot 架构
1. BrainBox 不是 MBRL / 世界模型——这是核查定调,整门课的基线。
2. 它自述的三支柱:物理信息 Neural ODE 预测 + 无模型 DRL 控制 + 安全门控部署。
3. "预测热响应" ≠ MBRL;MBRL 要把模型嵌进 RL 规划循环,BrainBox 没有公开证据这样做。
4. 能复刻的是原理与闭环,不是内部超参;凡是推测,课程里都标得清清楚楚。
下面哪一项,最能准确描述 BrainBox AI 的控制层(支柱 B)?
对了。BrainBox 控制层是无模型 DRL做设定值优化。 DreamerV3/RSSM 是 MBRL,把模型嵌进规划循环——BrainBox 没有公开证据这么做(事实核查已确认)。 传统 MPC 是白箱物理模型,BrainBox 自述是"黑箱深度学习 + 物理先验",不是纯白箱。
- 仓库内事实核查:world-model-brainbox-factcheck.md(专利 / 官网 / CBO 学术 / Trane 公告逐条核对)
- BrainBox Advancing AI 技术页:brainboxai.com/…/advancing-ai-…
- 研究材料(已修正归因):world-model-research.md §6.2.2 / §6.4.1