Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.062 — 2026-09-04
NEWS 约 1 分钟

测试出喜讯,先检查确认偏误

一场漂亮测试源于 R-hat 计算错误:结果越合心意,越要检查内部是否自洽。

软件跑出漂亮结果,就像体检报告一片绿色:人很容易先松口气,而不是追问仪器有没有算错。Bob Carpenter 披露,他在 StanCon 展示的 Walnutpie 测试成绩,源于接口计算 R-hat 和有效样本量(ESS)的错误。修复已进入 PyPI 的 0.0.3 版;原先在三个模型上的亮眼表现随之缩水,有些甚至完全消失。

R-hat 用多条 MCMC 采样链之间的差异判断它们是否已探索到同一分布,接近 1 通常较理想;ESS 则把彼此相关的抽样折算成等量的独立样本。出错的表格里,总计 4000 次抽样,部分参数的 ESS 只有约 300,R-hat 却仍接近 1;蒙特卡洛标准误(随机抽样带来的估计误差)与标准差、ESS 之间也对不上。团队没有及时警觉,正因为结果“很好,但并非好得离谱”。直到 Carpenter 无法在新版接口复现,并把结果交给 Claude 检查,表内矛盾才被指出。这次教训很朴素:测试不仅要问答案是否符合期待,还要检查不同指标能否彼此印证。


供稿材料 SOURCES — 1

← 返回 2026-09-04 · 数据板块