整理东京证券交易所的老档案,有点像把十年间格式各异的账本拼到一起:字段名、编码和文件布局会变,研究者往往还没分析交易,就先耗在清洗数据上。开源 Python 库 tse_tick 给这些 Nikkei NEEDS 逐笔档案做了统一入口。逐笔数据记录每次成交和报价更新,可用于研究价差、流动性和交易时序。
它覆盖 2016—2025 年、四类数据和两个格式年代,并自动识别文件类型与年代。用户可以直接从 ZIP 中筛选股票与时段,也可以先转成 Parquet——一种便于按列压缩和查询的存储格式——再用 DuckDB 的 SQL 反复检索。最实在的一点是,作者把写入过程改成分块流式处理:在测得的最极端交易日,峰值内存从 24.5 GB 降至 2.4 GB。作者还报告,代表性档案的解析速度较原 pandas 原型快 59.8 倍;单只股票的时段查询约快 410 倍。基准来自一台 16 线程普通工作站,换机器和查询条件后表现可能不同。