Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.055 — 2026-08-28
PAPER H 6 约 1 分钟

东京逐笔数据多了统一入口

tse_tick统一读取十年东京逐笔档案,让研究者少从清洗旧数据做起。

整理东京证券交易所的老档案,有点像把十年间格式各异的账本拼到一起:字段名、编码和文件布局会变,研究者往往还没分析交易,就先耗在清洗数据上。开源 Python 库 tse_tick 给这些 Nikkei NEEDS 逐笔档案做了统一入口。逐笔数据记录每次成交和报价更新,可用于研究价差、流动性和交易时序。

它覆盖 2016—2025 年、四类数据和两个格式年代,并自动识别文件类型与年代。用户可以直接从 ZIP 中筛选股票与时段,也可以先转成 Parquet——一种便于按列压缩和查询的存储格式——再用 DuckDB 的 SQL 反复检索。最实在的一点是,作者把写入过程改成分块流式处理:在测得的最极端交易日,峰值内存从 24.5 GB 降至 2.4 GB。作者还报告,代表性档案的解析速度较原 pandas 原型快 59.8 倍;单只股票的时段查询约快 410 倍。基准来自一台 16 线程普通工作站,换机器和查询条件后表现可能不同。


供稿材料 SOURCES — 1

← 返回 2026-08-28 · 量化板块