把数据加工想成一间厨房:Git适合保管菜谱、配料表和每次修订记录,却不会替你储存食材、开火做菜或盯着工序。Reddit 用户 ben1200 提出的 PoC(概念验证)设想,是先在 Git 中约定 schema(数据结构)、manifest(数据清单)和 ETL 流水线,再通过 CI/CD 自动处理数据,待团队达成一致后迁往 GCP,并用 GCP functions 执行 ETL——也就是抽取、转换和加载数据。
这个方向的关键是把 Git 放对位置。它可以充当控制平面:保存规则、版本和发布声明,也可以触发流程。但大规模数据仍需另行存储;任务的启动、重试和监控要靠编排系统;数据血缘——某个报表数字来自哪张表、改动会影响谁——也不会仅凭提交记录自动出现。说白了,Git很适合治理“数据应该怎样被处理”,不等于它能记录“数据实际怎样流动”,更不是存储和运行系统。原帖只描述了设想,未披露具体架构或验证结果。