Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.086 — 2026-09-28
PAPER 约 7 分钟

时序验证的不可能三角

一篇预印本给时序回测划出硬边界:训练量、测试覆盖与样本隔离,无法同时拉满。

你想检验一套交易策略,手里只有十年数据。最自然的愿望是:每次训练都尽量用满十年,测试又覆盖各种行情,而且模型绝不偷看测试日之后的数据。问题在于,这三件事互相抢同一段时间。测试越往前推,当时可用的历史越少;若仍坚持大训练集,就只能把后来的数据拿去“预测”过去。

Jiayu Li 的预印本《The Impossible Trinity of Time-Series Validation》试图证明:这不是切分技巧不够聪明,而是时间顺序带来的硬约束。论文把它称为时序验证的“不可能三角”和“守恒律”。这些结论目前全部来自作者本人的预印本,尚无第三方复现;论文发布日期的搜索元数据还出现过不一致,因此不宜把它写成已经同行评审确认的普遍定律。

三个愿望,共用一笔预算

先定义三个量。α 是最弱一次训练所用的数据比例,也就是“训练充分度”;β 是所有测试集合起来覆盖的样本比例;Λ 是相对于某些测试点,训练集使用了多少未来数据,即“反因果质量”。

论文声称,任意长度为 T 的样本划分都满足:

α+β≤1+Λ

如果严格禁止未来数据,Λ=0,便得到:

α+β≤1

直觉并不复杂。假设你希望测试覆盖十年中的八年,即 β=0.8。若每个测试点都只能由更早的数据训练,那么最早那批测试面对的历史必然很短,最弱一次训练至多占全部样本的两成,即 α≤0.2。反过来,若要求每次训练至少用八成数据,就不可能再用严格因果的方式测试八成时期。

这里的关键是“最弱一次”。后期测试当然可以积累很长的训练历史,但早期测试没有这个条件。把各次结果平均起来,也不会凭空创造早期历史。论文进一步声称:当等长、互不重叠的测试块覆盖全部样本时,即使改看平均训练量,严格因果方案平均也至多使用约一半样本。

越过边界,就得借用未来

这条不等式也给出了越界的价格。若 α+β>1,论文认为,某些测试点的训练集必然含有其未来样本。换句话说,高训练量和高覆盖率并非免费兼得,它们把代价藏进了前视偏差——用后来才知道的信息评估过去能否执行的策略。

论文还区分了两个容易混在一起的问题:偷看了多少未来,以及未来离测试点有多近。设 δ 为测试点与最近未来训练样本的距离,它给出另一条约束:

α+min{β,δ/T}≤1

因此,一旦使用未来数据,最近的那部分未来训练数据必然距离某个测试点不超过 (1−α)T。训练集越大,可用于拉开这段距离的空间就越少。

这解释了为什么“删除测试区附近样本”会损失训练量。Purging 是清除与测试标签窗口重叠的训练样本;embargo 是在测试块周围再留出隔离带。两者都在用样本数量换取时间距离,并没有让不可能三角消失。

真正危险的是多近,不只是用了多少

论文的统计层结论需要额外条件。它假设序列满足 β-mixing——可以粗略理解为:相隔越远,两段数据的依赖越弱。若损失函数有上界 M,论文给出的单个测试点泄漏偏差上界是:

2Mβmix(δ)

在这一假设和上界内,决定危害的是最近未来样本的距离 δ,而不是未来样本总数。若序列很快“忘记”过去,扩大 embargo 可能迅速降低依赖;若记忆很长,隔离带就要吞掉大量训练数据。

作者用纯噪声实验展示这种差别:真实可预测性应为零,shuffled 5-fold——先打乱时间再做五折交叉验证——报告的 information coefficient(IC,预测值与实际结果的相关系数)为 $+0.32$;contiguous 5-fold——保留时间顺序、按连续区块分折——在使用相同未来数据量时仅为 $+0.004$。论文据此强调,打乱后的未来样本贴近几乎每个测试点,更容易制造虚假的预测能力。

但这只是论文中特定实验的结果。摘要材料没有完整交代样本长度、随机种子、重复次数和不确定区间,不能把两个数字当作两类方法的一般性能差。

哪种方案站在哪里

论文把 expanding walk-forward 放在严格因果验证的 Pareto frontier——帕累托前沿,也就是在不偷看未来的前提下,无法再同时提高训练充分度和测试覆盖率。它从一段初始历史开始训练,向后测试;随后扩大训练窗口,再测试下一段。初始窗口越大,最弱训练越充分,但能覆盖的测试时期越少。

普通 k-fold cross-validation 则走向另一端。它让每一折都用大部分样本训练,并让全部样本轮流接受测试,但对早期测试块而言,训练集包含大量未来数据。论文因此称它在所比较的方案中“购买”了最多未来数据。这个说法描述的是论文定义下的样本划分坐标,不等于任何 k-fold 在任何序列上都必然产生同等严重的偏差。

Purged k-fold 加 embargo 采取折中:删掉测试块附近的训练样本,把未来数据推远。如果过程遗忘得快,这笔距离成本可能较低。不过,隔离只能缓解相邻样本依赖造成的泄漏。面对非平稳性——数据分布随时间变化——后来数据即使离得很远,也可能已经见过过去部署时不可能知道的市场状态。论文明确认为,embargo 不能修复这一层因果问题。

为什么值得关注

这篇预印本最有价值的地方,不是又推荐一种回测切法,而是要求研究者公开账本:训练最少用了多少数据,测试真正覆盖了多少时期,是否使用未来数据,以及未来数据离测试点多远。

它也提醒我们,回测没有一个对所有目标都最优的按钮。若要模拟策略当时能否执行,expanding walk-forward 更贴近真实部署,但早期训练不足会让评估偏保守。若主要做模型比较,并且有理由相信过程较稳定、依赖会快速衰减,purged k-fold 加 embargo 可以用训练量换隔离距离。若标签跨越多个时期,还要把标签尚未结束和窗口重叠造成的信息泄漏一并清除。

说白了,验证方案不是“严谨”或“不严谨”的二选一。它是在几种误差之间报价。可信的回测应该说明自己付出了哪一种价格,而不是只展示最后那条漂亮曲线。

局限与未知

  • 全部主要结论和实验数字目前只有 Jiayu Li 这一个作者来源,尚无独立论文交叉印证或第三方复现。
  • 2Mβmix(δ) 依赖 β-mixing、损失上界等条件;“距离比数量重要”不能脱离这一统计框架泛化。
  • 信息泄漏偏差、非平稳性造成的历史失真,以及普通预测误差是不同问题。不可能三角提供统一账本,但并未让它们变成同一种风险。

供稿材料 SOURCES — 1

← 返回 2026-09-28 · 量化板块