如果把企业数据仓库想成一间厨房,Fivetran负责把各处的食材运进来,dbt则把原料加工成报表和AI都能直接使用的成品。现在,这两个上下游工具归入同一家联合实体,dbt的核心引擎也同时换代。值得关注的不只是“跑得更快”,而是谁来决定开源项目的路线、哪些能力免费,以及它将如何服务越来越多的AI智能体。
据dbt官方博客,dbt Core v2.0已经推出早期alpha版,并采用Apache 2.0许可证。以下产品能力、用户数字和效果数据均来自Fivetran与dbt Labs自身,尚无独立信源或外部基准。
两套引擎,重新并成一套
dbt Core是一款开源命令行工具。数据分析工程师可以用SQL定义数据模型、检查依赖、运行测试并生成文档。它处在ELT流程的最后一段:数据先被抽取并装入仓库,再由dbt借用仓库算力完成转换。
过去的问题是,dbt同时维护着两条技术路线。传统dbt Core基于Python,使用Apache 2.0许可证。dbt Labs收购SDF Labs后,把后者的Rust引擎与dbt结合,推出dbt Fusion。Rust是一种偏重性能与可靠性的编程语言;Fusion则采用Elastic许可证。
两套引擎并行,意味着技术基础和授权方式都不相同。官方称,在为Fusion准备GA——即面向一般用户正式可用——的过程中,团队决定把两者重新合并。结果就是dbt Core v2.0:它改用Fusion建立的Rust实现,并继续以Apache 2.0授权。官方博客称alpha版于6月1日发布,目前仍处早期阶段。
这里的“引擎”,可以理解为厨房里的调度台。dbt项目中的模板、引用和配置,必须先被解析成数据库能执行的SQL,再按照依赖关系安排运行。引擎决定这套解析和调度有多快,也影响兼容性。
官方把Fusion定义为Core v2.0的超集:两者共享核心技术,但Fusion还包含额外能力,其中重点是对SQL的理解。换句话说,免费开源版换上了新的发动机,商业产品仍在其上增加功能。官方称Core v2.0相较v1是“严格升级”,命令行响应也显著加快,但材料没有提供基准测试、对照环境或具体耗时。
不只提速,还在铺一层AI上下文
另一个变化是元数据——描述数据来自哪里、如何加工以及运行结果的信息。dbt过去会生成manifest.json和run_results.json等文件;v2.0还会生成Parquet文件。Parquet是一种适合分析查询的列式文件格式。用户可以通过本地分析工具DuckDB直接查询这些文件,了解自己的dbt项目。
官方把它视为“上下文层”的基础。道理并不复杂:AI智能体若要使用企业数据,不能只拿到一张结果表,还要知道字段含义、加工路径和依赖关系。否则,人类分析师尚能凭经验发现异常,自动行动的智能体却可能把错误直接带进业务流程。
围绕这个方向,官方还发布了两项产品。dbt State是缓存层——把已经完成的中间工作暂存起来,避免反复计算。官方称它能让客户由dbt驱动的计算量降低30%以上,但没有披露样本量、测试环境和统计口径。dbt Wizard则是专为dbt开发的coding agent,也就是能协助编写代码的AI智能体。
Fivetran与dbt想把边界画得更大
官方博客已经以“Fivetran + dbt Labs”这一联合实体表述两家公司,并称Taylor Brown担任Co-founder and COO,Tristan Handy担任Co-founder and President。不过,材料没有给出交易条款或法律完成时间。
这次结合把数据搬运与数据转换放到同一叙事里。官方给出的理由是,现代数据栈过去主要服务人类报表,如今AI和智能体也开始消费数据并采取行动。它将风险概括为三类:数据不完整、指标不一致会破坏信任;缺少治理的数据会被智能体放大;重复检索和低效建模会推高计算成本。
其答案叫“Open Data Infrastructure”:存储与计算分离,使用Iceberg、Delta等开放格式,把数据移动和转换放在流水线层,并由管理与治理层提供元数据和上下文。官方还预测,智能体时代的数据消费量将至少增长一个数量级。这是公司对未来需求的判断,并非已经得到验证的行业事实。
官方称,超过10万个团队把dbt用作数据转换标准,超过8000家客户使用Fivetran复制数据。这些数字说明两者合并可能影响相当广的用户群,但材料没有给出统计日期、活跃口径或第三方核验。
真正要看的,是边界如何落地
Core v2.0的重要性,在于它同时回应了三个问题。技术上,开源Core与商业Fusion不再维护两套完全不同的基础。产品上,dbt正从SQL转换工具延伸到缓存、元数据上下文和coding agent。公司层面,Fivetran与dbt则试图覆盖从数据进入仓库,到加工、治理,再到AI消费的更长链条。
但Apache 2.0只说明Core v2.0这部分代码的授权方式,不能据此推断整个dbt平台都已开源,也不能证明未来所有关键能力都会留在公共版本。开源治理还包括谁决定路线、如何接受外部贡献、版本能否兼容,以及商业版与社区版如何划界。公司所有权改变后,这些规则比一次许可证声明更值得长期观察。
局限与未知
- Core v2.0仍处早期alpha阶段。材料没有提供完整兼容性范围、迁移成本或性能基准。
- Fusion被定义为Core的超集,但现有材料没有完整说明哪些能力只属于商业产品,长期边界仍不清楚。
- “计算量降低30%+”、用户规模和数据消费增长预测均出自官方,缺少统计细节与独立验证。