问企业 AI“本月净收入为什么下降”,它不只要找到数字,还得知道“净收入”怎么算、哪些人能看,以及工单和邮件里发生了什么。dbt 把这件事称为 context engineering——为模型挑选、组织并及时提供完成任务所需的资料。值得关注的是,数据仓库正从给 BI 报表供数,转向给 AI 代理提供可信的业务语境。
据 dbt 博客介绍,Databricks、BigQuery 和 Snowflake 已支持在 SQL 查询中调用 AI,并提供 embeddings(把文本转成便于比较的数字表示)和向量相似度搜索。Snowflake 有 AI_EMBED、AI_COMPLETE 和 AI_PARSE_DOCUMENT,Databricks 则提供 ai_extract、ai_classify 和 ai_summarize。dbt 的主张是:团队可以沿用现有数仓和建模流程,把表格与录音转写、工单、PDF、邮件等非结构化资料清洗、关联、说明并设置权限,不必另建一套向量数据库或机器学习系统。
这也把语义层——统一“活跃客户”“净收入”等业务概念和计算口径——从报表推到了代理检索前线。换句话说,analytics engineer 可能不再只维护人看的指标,也要维护 AI 取用事实时依赖的“上下文层”。不过,这篇文章主要提供方法主张和工具示例,未披露实际部署效果或量化验证。