把一箱文件搬进档案室,不等于你已经能按日期和作者找到它们。Ibrahim Salami 把文章数据定时装进 Postgres 后,也遇到了这个差距:表能查询,数据却不好用。发布日期被存成普通文本,每次筛选“最近 7 天”都要临时转换;作者或博客名则藏在标题的冒号前,无法直接统计谁发布得最多。
他此前搭了两条管道,却只完成了 ELT 里的 Extract 和 Load,也就是提取与装载,漏掉了 Transform——统一日期、拆分字段和整理表结构。于是他开始用 dbt:一种主要通过 SQL 定义转换、依赖和测试的工具。这里的“建模”也不是训练 AI,而是把原始表加工成能回答问题、可供报表使用的数据模型。
这次复盘最值得新手记住的,不是某个工具选择,而是交付标准:数据进库只说明“放进去了”;字段可比较、口径清楚,并经过日期解析、非空或唯一性等质量检查,才更接近“可分析”。查询能运行,从来不自动等于结果可信。