Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.044 — 2026-08-17
NEWS 约 1 分钟

Spotify用一套数据兼顾离线与在线

Spotify 给数据湖加“目录”,让分析与在线服务共用一份数据。

IMAGE — InfoQ 中文

同一份用户数据,分析团队要拿来训练模型,在线服务也要按用户 ID 迅速查出一条记录。过去常见的办法,是把数据再复制到专门的服务数据库里;数据越多,存储成本越高,两份数据还可能出现口径不一致。Spotify 推出的 Random Access Parquet(RAP),想让两类工作直接共用数据湖——集中保存海量数据的低成本存储层——里的同一份数据。

据 InfoQ 报道,RAP 最关键的一步,是给 Apache Parquet(适合批量分析的列式文件格式)加上一层外部索引。它像一份目录,直接记录某个用户 ID 位于哪个文件、哪一行。在线服务做“点查询”——按键寻找一条或少量记录——时,不必扫描数千个文件,而是先查索引,再定向读取对象存储中的一小段数据。Spotify 称,配合数据排序、列布局和覆盖索引,部分查询只需一次范围读取,读取量仅几 KB。

这套设计的价值不只是更快,而是少维护一套数据副本:分析、机器学习、AI 智能体和在线应用可以继续使用相同的 Parquet 数据集。不过,现有材料未披露完整的延迟、成本对比或生产规模测试结果,实际收益仍需更多数据验证。


供稿材料 SOURCES — 1

← 返回 2026-08-17 · 科技板块