给 Pivot 后端工程师的一门小课

吃透 Parquet

楼宇 IoT 时序数据放在 PostgreSQL 里,迟早会变成成本与查询性能的双重压力。 Parquet 是把冷数据搬走的标准答案——但"能写出文件"和"写出一个体积和查询都调过的文件", 差着六节课的距离。这门课从二进制布局讲起,每个结论都配一条可粘贴运行的命令。

全 6 课,每课 10–20 分钟。课程里每一个体积与耗时数字,都是在 432 万行真实规模的样本上跑出来的。

从第 1 课开始 →
这门课要让你能做到的事
307 → 21.79MB · 同一份数据
7.85 → 0.03MB · 一个参数改时间戳列
44 → 1个 row group · 排序键选对

这三个数字分别是第 1、3、4 课的核心。它们都不是"用了 Parquet"就能自动拿到的。

课程目录

随时可查

动手工具

适合谁后端工程师(PG / Java 主栈,Python 够用,大数据生态零基础)
动手栈pyarrow + DuckDB(pip install pyarrow duckdb 即可)
总时长约 70–100 分钟(分 6 次更轻松)
基线pyarrow 25.0.0 / DuckDB 1.5.5,实测于 2026-08