Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.096 — 2026-10-08
NEWS 约 1 分钟

dbt State只重建真正变化的部分

dbt State 复用未变化的模型结果,让数据流水线少等待、少花计算费。

IMAGE — dbt Blog

想象一份每小时更新的报表:明明原料和做法都没变,系统却把所有表重新计算一遍。dbt State 正是用来省掉这类重复劳动的。dbt 模型通常是一段整理数据的 SQL;许多模型又前后依赖,组成一条数据流水线。每次全部重跑,不仅拖慢反馈,也会消耗数据仓库按量计费的计算资源。

现已正式可用的 dbt State,会把每个模型当前的 SQL 逻辑和上游数据新鲜度,与上一次成功构建比较。两者都没变,就直接复用原结果;若另一个 schema——可理解为仓库里的独立数据区域——已有逻辑相同且数据够新的结果,就复制过来;找不到有效结果时才重建。它遵循“先保证有效,再选最便宜动作”的原则,还会跳过已复用模型中过去已经通过的测试。

据 dbt 博客披露,平台每天构建超过 2200 万个模型,其中多数会在上游没有变化时照常重建。文中的并排演示显示,开启 State 后几乎所有模型都被复用;不过材料没有给出具体节省比例,实际收益仍取决于流水线中真正发生变化的范围。


供稿材料 SOURCES — 1

← 返回 2026-10-08 · 数据板块