你让模型仿造一段市场行情,它交出一条很“像”的曲线:涨跌自然,噪声不多,统计分布也差不多。可一旦拿它测试极端亏损,结果可能完全失真。就像一个人证件照拍得很健康,体检指标却不合格。
这正是 FinBench 想追问的问题。合成市场数据——由模型生成、在统计外观上模仿真实价格或收益的时间序列——常被用来扩充压力情景。但它有没有用,不能只看“像不像”,还要看它会不会误导风险测量、期权定价和策略比较。
目前全部结果都来自开发方 Sablier AI 相关人员的一篇 Reddit 帖文,尚无独立复现。下文的精确数字均为项目方自报。
长得像,不等于经得起交易
时间序列生成研究常用“判别分数”:训练一个分类器,看它能否分清真实数据和合成数据。分不清,生成器就得高分。
问题在于,这种考试可能奖励过度平滑。模型把噪声和极端变化平均掉,曲线会比真实市场更规整,也更难被简单分类器识破。但真实收益常有重尾、波动率聚集和杠杆效应:极端涨跌比温和分布更常见,大波动容易扎堆出现,价格下跌还可能伴随波动上升。抹掉这些特征,恰恰会损害回测和风控。
项目方称,FinBench 评测了 18 个模型,包括深度生成模型、经典计量经济模型和重放基线。它不只问合成数据像不像,而是安排了 7 类量化任务:连续时间序列的典型事实,W1、MMD 和 sig-MMD 等分布距离,鞅检验,隐含波动率微笑重新定价,VaR/ES 回测,以及 TSTR 策略排名迁移。
这里的 TSTR 是“在合成数据上训练、在真实数据上测试”。它关注的不是某条策略单独赚不赚钱,而是合成数据能否保留策略之间的相对排序。隐含波动率微笑则是期权价格反映出来的一种风险形状;重新定价是在检查合成行情能否支持相近的期权估值。
它把模型送进了风控室
最直接的一关是 VaR 和 ES。VaR 给出某个置信水平下的损失分位数;ES 再追问:损失一旦超过这道门槛,平均会有多严重。回测会检查越过 VaR 的次数是否符合预期、这些越界是否彼此独立。这样才能判断模型有没有复现尾部风险的频率和聚集性。
据项目方披露,TimeGAN 在 VaR/ES 回测中的得分是 0.000 ± 0.000,TimeVAE 和 KoVAE 也是如此。这个指标的具体定义没有在供稿中说明,因此不能把它解释成“风险为零”或“误差为零”。能确定的只有:按开发方的评分口径,这三款模型在该项没有拿到有效分数。
另一个醒目的结果来自策略排序。项目方称,TimeVAE 的 TSTR Spearman 相关系数 。Spearman 相关系数衡量两个排序是否一致;负值意味着,在这次测试里,合成数据给出的策略次序与真实数据呈反向关系。对量化研究者来说,这比曲线不够逼真更麻烦:它可能让人优先选择错误的策略。
老办法反而排到第三
FinBench 里还有一个朴素的 block bootstrap——把真实时间序列切成连续片段,再抽样拼接,以尽量保留片段内部的时间关系。它不是深度生成模型,却在 18 个模型的综合排名中位列第三。
项目方进一步声称,多数已发表模型排在它之后,而专门面向金融结构设计的模型能够跨过门槛。但帖文没有给出完整榜单、明确阈值和模型定义,这两项说法暂时只能视为项目方判断,不能据此断言“大多数深度模型整体不合格”。材料能够直接支持的较窄结论是:在 7 项任务中的 3 项上,多数参评模型处于或劣于 real-vs-real 噪声下限。
所谓 real-vs-real 噪声下限,是先比较两组真实样本,看看即使数据都是真的,有限抽样本身会带来多大差异。FinBench 还采用 Holm 校正,控制同时做多项显著性检验时更容易出现的误报。评测使用一个冻结的样本外面板:7 个特征、200 条路径,每条预测长度为 。
为什么值得关注
这套基准最有价值的地方,不是给某个模型判死刑,而是改变考试题。过去的高分可能只说明合成数据在有限统计量或分类器面前足够逼真;FinBench 要求它进一步证明,自己不会在尾部风险、期权定价和策略选择上把人带偏。
项目方还提供了审计入口:仓库采用 MIT / CC-BY 许可,冻结 git tag,归档各模型输出,并称可通过 python -m benchmark.run 重新计算完整榜单。这让外部研究者能够检查评分过程,但仍不能替代独立复现。
局限与未知
- FinBench v1 只有一个数据面板、一个样本外时间窗口,以及 200 条长度为 60 的路径。覆盖范围和统计功效有限,不能外推到所有市场、资产或生成模型。
- 榜单包含 Sablier AI 自己的模型,外部基线按公开默认配置运行。可复算设计提高了透明度,但开发方自建基准、自评产品,仍存在利益冲突。
- 帖文没有提供完整排名、逐项数据和若干分数的定义。现有证据足以质疑“外观相似就是可用”,尚不足以证明多数已发表模型整体都没通过基础体检。