Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.054 — 2026-08-27
NEWS 约 4 分钟

1.5TB行情,四分钟内跑完

BMLL称1.5TB行情可在四分钟内处理;一个可核对的加载案例中,Polars比pandas快约48倍。

IMAGE — Polars Blog

想象你要整理一座体育场十年的逐秒录像,却必须先等几个小时才能打开当天的文件。对研究市场的人来说,海量行情数据也有类似问题:数据不只多,还要按极细的时间顺序拼接。BMLL在一篇发表于Polars官方博客的客户案例中称,借助Polars,1.5TB行情数据可在四分钟内处理。更具体、也更容易理解的一项对比是:加载全市场单日美国股票成交数据,时间从接近3.5分钟降到4.3秒,约快48倍。

先说明信源边界:本文所有性能数字均来自BMLL美洲数据科学主管Thomas Jardine的署名供稿,发布于Polars官方博客,没有独立测试或可复现实验交叉验证。

为什么行情数据这么难搬

BMLL提供全球股票、ETF、期货和美国股票期权的历史行情与分析,覆盖100多个交易场所,并把数据统一到纳秒精度。纳秒是一秒的十亿分之一。如此细的时间戳,主要用于给高速发生的委托和成交排序;它不等于每个市场事件都能被绝对无误地还原。

行情还有不同深度。Level 1通常记录最优买价、最优卖价和最近成交价;Level 2加入订单簿中更深的报价档位;Level 3进一步保留每笔订单的提交、修改和撤销。层级越深,越适合研究交易如何发生,数据量也越大。BMLL称,仅分析一个交易日的全市场逐笔数据,就可能涉及数十到数百GB。

这类工作过去常用pandas——一种常见的表格数据处理工具。BMLL给出的案例覆盖单日全部美国股票成交,以及超过1.1万只REG NMS证券。仅加载数据,pandas就耗时接近3.5分钟,尚未开始连接或汇总;Polars加载相同数据用时4.3秒,按210秒粗略计算约为48.8倍,与文章所称“约48倍”基本一致。

快的不只是“打开文件”

Polars是开源DataFrame引擎,也就是处理表格数据的计算工具。它采用列式处理:把同一字段集中计算,查询时只读取需要的列。面对“扫描大量成交、再按少数几个字段统计”这样的任务,这种方式通常更合适。

文章还提到两个实用能力。其一是惰性执行:分析师可以先写好多步查询,Polars统一规划后再计算。其二是as-of join,可译为“按时间就近连接”。普通连接要求两个时间完全相同;它则能把每笔成交匹配到该时刻或此前最近的一条报价,相当于寻找成交发生时市场上刚刚有效的订单簿状态。BMLL称,Polars原生支持这种连接,并会自动使用全部可用CPU核心。

1.5TB与四分钟,该怎样理解

案例披露,基准运行在BMLL Data Lab的一台机器上,配置为192核CPU和1.5TB内存。测试涉及两个市场和三类分析。其中一项覆盖上海证券交易所2026年3月1日至16日的16个交易日,包括约268GB成交数据和1.2TB Level 2订单簿数据,两者合计接近标题所说的1.5TB。

但供稿片段没有给出这项任务的精确耗时拆分,也没有说明“四分钟”是否包括读取、解压、查询和结果输出。因此,它更适合作为特定环境下的工程案例,不能直接理解为任意电脑、任意1.5TB数据都能在四分钟内跑完。

这个案例真正值得关注的地方,是它展示了一个更具体的变化:当加载时间从分钟降到秒,研究人员可以少做抽样,更频繁地在完整数据上修改问题、重新计算。BMLL目前也因此推荐客户用Polars编程处理其行情数据。

局限与未知

  • 全部结论来自一篇兼具客户案例与产品推广性质的署名文章,缺少第三方复测。
  • 48倍只对应单日美国股票成交数据的“加载”环节,不能外推为完整分析流程都快48倍。
  • 材料未披露文件格式、缓存状态、软件版本和线程设置;这些信息会影响复现与横向比较。

供稿材料 SOURCES — 1

← 返回 2026-08-27 · 数据板块