把仓库里的文件搬进分析系统,看似只是“复制一次”,账单却可能在路线和搬法上膨胀。一名数据工程从业者在 Reddit 求助:其 GCS(Google Cloud Storage,云端文件仓库)位于 single-region(单一区域),BigQuery(托管分析型数据仓库)却在 multi-region(跨多个区域的较大范围)。两者位置不兼容,批量加载 Parquet 文件时会产生高额跨区传输费。
更麻烦的是,这套流程并非只搬新增数据。由于数据集没有分区,当前使用 WRITE_TRUNCATE:先清空目标表,再整体重写;上游环境也会覆盖重写。换句话说,同一批历史数据可能反复跨区搬运。外部表虽然能让 BigQuery 直接读取 GCS、少一次持久化复制,但查询扫描成本、性能和位置限制仍要另算。这个案例的提醒很直接:迁移前要一起核对存储位置、加载方式和查询路径,不能只比较每 GB 的传输单价。原帖仅提出问题,未披露账单数字,也没有给出经过验证的最省钱方案。