Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.037 — 2026-08-10
PAPER H 25 约 6 分钟

序贯检验何时才该停

一套给持续实验设“双门槛”的停止规则:证据要明确,估计也要够准。

你一边抛硬币,一边判断它公不公平。前几十次恰好连续出现正面,看起来已经很可疑;再抛几百次,比例却可能慢慢回到一半。持续实验的难处就在这里:数据可以随时查看,但“现在看起来有答案”不等于“答案已经可靠”。Eyal A. Kazin 的论文把停止条件拆成两道门槛:结论必须明确,估计也必须足够精确。只有两者同时满足,实验才收尾。

这套方法叫 Decisive Precision is the Goal(DPitG),可译作“以明确且精确为目标”。论文用模拟比较了三种停止办法。所有结果都来自这一篇 arXiv 论文及其作者体系,尚无独立复现;下文数字应理解为论文报告,而非已经确立的通用保证。

先分清两个问题

序贯检验允许研究者在数据陆续到来时反复查看证据,并决定是否继续。它适合 A/B 测试、质量监测等持续收集数据的场景。但停止规则必须提前定好。否则,人总可能在结果最顺眼的一刻停下,把暂时的随机波动当成真实效应。

论文使用贝叶斯分析。它把未知参数表示成一条会随数据更新的后验分布:分布的位置告诉我们结果大致在哪里,宽度表示还有多少不确定性。

作者再用两个工具读这条分布。一个是 HDI(Highest Density Interval,最高密度区间),即后验分布中聚集了指定概率质量、密度最高的一段范围;论文采用 95% HDI。另一个是 ROPE(Region of Practical Equivalence,实际等价区间),即围绕“无效应”预先划出的一小段可忽略范围。

若 HDI 完全落入 ROPE,可以支持“效应在实践上可忽略”;若 HDI 完全落在 ROPE 同一侧之外,可以支持存在有实际意义的效应;若两者交叠,则结论仍不明确。这里的“接受无效应”不是断言参数精确等于某个值,而是说当前证据支持它落在事先认可的可忽略范围内。

只等答案,可能停得太早

第一种办法是 HDI+ROPE stopping:只要 HDI 与 ROPE 的关系能给出明确结论,就停止收集。

它的问题是把“何时停”和“得出什么结论”绑在了一起。早期样本少,HDI 通常较宽,位置也容易被偶然出现的极端样本带偏。一个宽而偏的区间仍可能整体落到 ROPE 之外,于是实验过早结束。论文把这种风险称为 early peeking,也就是反复查看数据时,被早期、缺乏代表性的结果诱导。

在论文的公平硬币模拟中,HDI+ROPE 的明确结论率为 98.2%,但错误拒绝公平假设的比例为 6.3%。它很会给答案,却不总能等到估计稳定。

只等精度,又可能没有答案

第二种办法是 Precision is the Goal(PitG)。它把停止与结论彻底拆开:预先规定 HDI 的目标宽度 ω,等区间缩窄到这个程度就停,然后才看 HDI 与 ROPE 的关系。

这能避开“看到想要的结果就停”的诱惑,却带来另一种尴尬:估计已经够精确,区间仍可能跨着 ROPE 边界。实验按规则结束了,却只能说“没有结论”。当真实情况位于或接近 ROPE 内部时,这个问题尤其明显。

在论文的公平硬币设置中,ω=0.08,ROPE 为 0.5±0.05。PitG 的明确结论率只有 37.9%,也就是约 62% 的实验停下时仍无法接受或拒绝公平假设。

双门槛怎样收尾

DPitG 的改动很小:达到目标精度只是必要条件,不再是充分条件。实验必须同时满足:

  1. HDI 宽度不超过预设的 ω
  2. HDI 完全位于 ROPE 内,或完全位于其同一侧之外。

如果精度够了但结论仍卡在边界上,就继续收集,直到得到明确判断,或碰到预先设定的最大样本预算。可以把它理解为交卷前的双重检查:不但字迹要看得清,答案也必须写完整。

在上述公平硬币模拟中,DPitG 的明确结论率达到 97.8%,把 PitG 约 62% 的无结论率降到约 2%。其中位停止样本量为 627,PitG 为 599,增幅约 4.7%,即核查备注所概括的约 5%。这不是固定成本,而是该组模拟中的中位数差异。

该模拟还观察到 DPitG 没有错误拒绝公平假设。这个结果只适用于论文给出的特定参数与实验设置,不能理解成方法普遍保证零假阳性。论文还报告,在其测试过的 ω 范围内,DPitG 的明确结论率始终高于 97%;材料没有完整列出所有相关运行条件。

为什么这值得关注

它最有价值的地方,不是又发明了一个统计阈值,而是把两个经常混在一起的问题摆回各自的位置:证据是否足以支持一个明确判断,以及估计本身是否已经稳定。

论文也给出样本规划的比例关系:

NVω2

其中 V 是观测方差,ω 是目标 HDI 宽度。直觉上,数据越嘈杂,所需样本越多;想把区间宽度压得更窄,样本需求会按平方速度上升。这只是比例关系,并非仅凭材料就能直接套用的完整公式。

DPitG 的停止条件可以在实验前完整写定。作者因此称它符合预注册标准——即先公开分析与停止规则,再收集数据,减少事后挑规则的空间。论文还提供在线计算器和开源代码,并在单组二元数据上演示;作者称框架可扩展到连续结果和两组比较。

局限与未知

  • 目前证据只来自作者的一篇论文。材料未提供代码仓库和计算器链接,无法核查实现或复现模拟结果。
  • 公平硬币实验中的零错误拒绝和约 5% 样本增幅都依赖特定设置;换用更宽松的精度目标时,论文报告的中位样本代价最高可明显增加。
  • 论文实际演示的是单组二元数据。向连续结果和两组比较扩展是否同样稳健,仍需独立验证。

供稿材料 SOURCES — 1

← 返回 2026-08-10 · 数据板块