一份 Excel 报表如果每周都要复制数据、拖公式、再另存新文件,真正麻烦的往往不是计算,而是没人说得清中间改了什么,出错后也难以重来。ssbt 想把这套手工流程变成一条明确的构建管线——按依赖顺序自动执行加工步骤,并能重复生成结果。
据项目作者 7 月 21 日在 r/dataengineering 的发布帖介绍,ssbt 借鉴了 dbt(data build tool,把数据加工写成可依赖、可测试、可版本管理的 SQL 模块),但把使用场景缩小到本地 Excel 文件。用户用 SQL 写处理逻辑,用 YAML——一种便于人读写的配置格式——组织规则,最后输出另一份 xlsx。这样,表格加工过程可以交给 Git 等版本控制工具记录,也能加入测试,不再只剩一份难追溯的成品文件。
它的主要执行引擎是 DuckDB——一种可直接嵌入程序、在本机用 SQL 处理文件的分析型数据库,因此作者称无需另行配置数据库。它适合仍离不开 Excel、又觉得完整 dbt 流程过重的团队;不过目前材料只有作者的项目介绍,尚未披露实际项目中的性能、兼容范围或测试效果。