同一份用户数据,分析团队要拿来训练模型,在线服务也要按用户 ID 迅速查出一条记录。过去常见的办法,是把数据再复制到专门的服务数据库里;数据越多,存储成本越高,两份数据还可能出现口径不一致。Spotify 推出的 Random Access Parquet(RAP),想让两类工作直接共用数据湖——集中保存海量数据的低成本存储层——里的同一份数据。
据 InfoQ 报道,RAP 最关键的一步,是给 Apache Parquet(适合批量分析的列式文件格式)加上一层外部索引。它像一份目录,直接记录某个用户 ID 位于哪个文件、哪一行。在线服务做“点查询”——按键寻找一条或少量记录——时,不必扫描数千个文件,而是先查索引,再定向读取对象存储中的一小段数据。Spotify 称,配合数据排序、列布局和覆盖索引,部分查询只需一次范围读取,读取量仅几 KB。
这套设计的价值不只是更快,而是少维护一套数据副本:分析、机器学习、AI 智能体和在线应用可以继续使用相同的 Parquet 数据集。不过,现有材料未披露完整的延迟、成本对比或生产规模测试结果,实际收益仍需更多数据验证。