你拿到一段伪造的电影,可以逐项检查:演员长得像,色调也像,台词长度差不多。但如果上一幕的人物下一幕凭空消失,它仍不是一部连贯的电影。合成订单簿也有类似问题:价差、成交量等统计特征可以分别逼真,价格层级和前后时刻之间的关系却可能是错的。
这正是 LOB-ID 想解决的问题。它不是再添一张统计指标清单,而是给真实与合成订单簿计算一个整体距离。这个问题值得现在关注,因为生成式市场数据已被用于回测、执行分析和风险研究;一套看起来像市场、实际结构松散的数据,可能让研究结果建立在错误的地基上。本文所述效果均来自作者自己的实验,尚无独立复现。
逐项合格,不等于整体可信
限价订单簿(limit order book,LOB)记录各个价位上尚未成交的买卖委托及数量,可以把它理解为价格形成和交易执行的即时地图。Level-2 数据展示买卖两侧多个价位的汇总状态。一本合成订单簿不仅要在某个截面上像真的,还要让流动性、买卖两侧和不同价位随时间合理演化。
过去常见的办法,是检查 stylised facts——金融数据中反复出现的经验规律,例如订单是否聚集到达、价差和成交量呈现怎样的分布。这类检查必要,也容易解释,但它们通常一次只看一个切面。模型完全可能对上若干边际分布,却没有保留变量之间的联合结构。
LOB-ID换了一个角度:先让神经网络把一段复杂的订单簿轨迹压缩成特征向量,再比较真实数据与合成数据在这个特征空间中的整体分布。这个过程叫表示学习,得到的向量叫 embedding。直观地说,系统不再逐项核对演员、色调和台词,而是尝试判断整段剧情的组织方式是否相似。
先造一把懂订单簿的尺子
图像生成领域早已使用 Inception Distance:把真实图片和生成图片交给预训练网络提取特征,再比较两组特征的分布。距离越小,通常表示二者在这套特征表示下越接近。但自然图片网络不懂交易,因此不能直接拿来量订单簿。
作者训练了 DeepLOB——一种从订单簿数据预测短期中间价方向的神经网络——然后去掉其后端的循环与分类部分,保留 Inception 模块作为特征提取器。训练数据覆盖2025年9月至12月、香港交易所五只流动性较高的股票:腾讯、快手、网易、美团和百度。原始数据是逐笔消息,最终送进评分器的则是买卖两侧各十档的 Level-2 状态窗口。
LOB-ID在这些 embedding 上计算两种距离。FID(Fréchet Inception Distance)把两组特征分布近似成高斯分布,主要比较均值与协方差,也就是前两阶矩。MIND(Monge Inception Distance)则沿许多随机方向把高维特征投影成一维,再比较投影后的分布。后者不只看均值与协方差,因此能发现更多分布形状上的差异。两种分数都是越低越相似。
关键不在于公式更复杂,而在于尺子观察什么。LOB-Bench一类统计评估可以告诉研究者“价差哪里不对”“成交量哪里偏了”;LOB-ID试图补上另一问:这些局部特征组合起来,是否仍像一条连贯的市场轨迹。
两次“作弊测试”暴露了什么
作者先做了受控失真实验。他们逐渐加入价格趋势、随机游走、单次跳跃,或删除部分时间行。论文报告称,MIND在四种扰动下都随失真强度稳定上升,没有出现反转。随机游走持续影响各价位,删除行则破坏事件间隔与时间结构,因此反应更明显。
更有意思的是两次针对评分体系的“作弊”。第一次专门攻击FID:作者修改订单簿输入,让 embedding 的均值和协方差尽量接近真实数据,同时扩大分布形状的差异。FID并非完全看不见攻击,但明显低估了剩余失真;MIND仍把攻击数据放在真实样本之间自然差异之外。原因很直接:两组数据即使均值和协方差相近,完整分布也可以不同。
第二次攻击统计指标。作者保留价格、时间戳、消息特征和最优档位,只重新排列更深档位的数量与订单数。这种处理维持了被检查的边际分布和价格冲击响应,却拆散了深档流动性与时间、最优档、买卖两侧及市场状态之间的联系。论文报告,所评估的LOB-Bench统计量和冲击响应没有识别出这一变化,MIND则在三只受测股票上都将攻击置于真实样本的抽样噪声之上。
这并不说明统计指标无用。恰恰相反,两类方法回答不同问题:统计指标适合定位具体症状,LOB-ID适合检查整体关系。较稳妥的做法是把它们并用,而不是用一个总分替代所有诊断。
五种生成器,排出了结构层次
论文还在同一数据和时间切分下比较了五类模型:Zero Intelligence、Compound Hawkes、LOBGAN、LOBS5和DiffLOB。Zero Intelligence独立抽取多种订单属性;Compound Hawkes加入事件到达的时间依赖;LOBGAN根据当前市场状态生成新订单;LOBS5直接建模较长的消息序列;DiffLOB联合生成跨时间、跨价位的Level-2轨迹。
在不使用未来条件的可比设置中,LOB-ID给出的顺序是DiffLOB、LOBS5、LOBGAN、Compound Hawkes、Zero Intelligence。这个顺序与各模型按设计能够表达的时间、跨档位和买卖侧依赖大致一致。不过,这只是内部合理性验证:作者并未用独立的回测收益、执行成本或真实交易效用证明该排名客观正确。
论文另列了使用未来条件的DiffLOB。它拿到了由真实未来轨迹计算的趋势、波动、流动性和订单流失衡信息,任务明显更容易,因此作者把它视作上限参考,而不是公平参赛者。
为什么值得关注
合成数据的价值,在于历史市场只发生过一次,而生成模型可以提供许多备选路径。但路径数量增加,不会自动带来研究可信度。若生成器只复刻了几个漂亮的统计特征,回测和执行模型可能学到一个局部逼真、整体不连贯的市场。
LOB-ID的重要推进,是把讨论从“像不像几个常见特征”推向“整体分布及联合结构有多接近”,同时给不同生成器提供一把可复用的尺子。它没有证明合成数据已可安全进入交易决策,却让研究者更难仅凭几张吻合的分布图宣布成功。
局限与未知
- 这把尺子依赖DeepLOB学到了什么。更换表示网络、预处理、样本量或随机投影方案后,绝对分数不能直接比较。
- 当前embedding只观察Level-2状态轨迹,不直接评估完整的逐笔消息生成过程;实验也只覆盖五只流动性较高的港股和四个月数据。
- MIND在论文设计的两类攻击中更敏感,不等于它在所有市场、资产和行情状态下都优于FID或统计评估。其稳定性、单调性和模型排序仍待外部复现,并需用实际回测与执行任务验证。