你给客服 AI 换了一版提示词。离线题库显示,它回答得更好了。现在能不能直接上线?未必。题库里的“答得好”,和真实用户是否少转人工、七天内是否不再来问,是两件事。离线评测可以帮团队快速试错,但要把它当成线上 A/B 测试的替身,还得回答一个更严格的问题:过去那些在离线评测中进步的产品改动,上线后是否也稳定带来了更好的真实结果?
Mårten Schultzberg 于 2026 年 10 月 7 日提交的预印本《When Can You Ship on Evals Alone?》试图给出一套可计算的判断框架。它不只是评估一个模型好不好,而是为每项改动安排三个去向:直接上线、放弃,或者继续做 A/B 测试。需要先说明,本文目前是单作者 arXiv 预印本,尚无同行评审或独立复现;下文的方法、模拟和数据结果均来自论文自身。
评测准,不等于能替代实验
离线评测(offline eval)是在预先准备的数据、题目或人工标签上比较新旧版本,不让真实用户接触改动。A/B 测试则把用户随机分到新旧版本,再比较点击、收入或问题解决率等真实结果。前者更快、更便宜;后者更接近团队真正关心的因果效果。
常见的评测验证会问:LLM judge——由大模型充当的自动评分员——和人工判断是否一致,或者某套评测能否把不同模型的优劣顺序排对。这些证据当然有用,却没有直接回答上线问题。
论文把分析单位从“回答”或“模型”换成了“产品改动”。一次提示词修改、检索方式调整、排序变化或模型替换,都算一个 intervention,也就是一次干预。团队需要比较两件事:这项改动让离线分数变化了多少,又让线上业务结果变化了多少。
如果在许多可比较的改动中,离线效果越大的改动,线上效果也稳定越大,离线评测才可能成为可靠的代理指标。论文把这种跨改动的关系称为 trial-level surrogacy,即“试验层代理性”。
这和 unit-level surrogacy(个体层代理性)不是一回事。后者关心的是,在一次试验内部,处理是否通过某个中间指标影响最终结果。论文用理论构造说明,两者在逻辑上彼此独立:个体层条件完全成立时,离线效果仍可能无法预测不同改动的线上效果;反过来,离线效果也可能准确指示线上效果的方向,即使个体层条件并不成立。
说白了,评分员很会判断单条回答,不代表“让评分提高的改动”一定能改善真实业务。
从历史发布记录里找“兑换率”
这套框架需要一批历史改动。每项改动都要同时有离线效果和线上 A/B 测试结果。团队再观察两者跨改动的关系,相当于估计“离线进步能兑换多少线上收益”。散点越集中,这种关系越稳定;散得越开,仅凭离线结果做决定就越危险。
难点是,两边的数字都有噪声。离线题目数量有限,因此离线效果只是估计值;A/B 测试的用户样本有限,线上效果也是估计值。噪声会让原本存在的关系看起来更弱:离线一侧的误差会压平趋势,线上一侧的误差会把点云撑宽。
论文在一个二元正态工作模型下处理这个问题。所谓“工作模型”,是为了完成计算而采用的一组简化假设,并非对现实的无条件描述。它从历史改动的样本协方差中,扣除每项改动内部报告的测量方差,以估计改动之间真正的协方差。直观地说,就是先把尺子本身的晃动从历史记录中减掉,再判断两个效果是否一起变化。
但到了新的改动,不能假装离线测量没有误差。框架会把这部分不确定性重新放回预测:离线评测越不精确,同一个观测分数背后可能对应的真实效果范围越宽。历史案例再多,也消除不了新评测本身的含糊;这只能靠更精确的评测来改善。
上线、测试,还是放弃
在正态模型、参数已知等条件下,论文推导出一套闭式规则,也就是可以直接代入参数计算的 ship/test/kill gate。
它关心的不是“离线分数是否显著提高”,而是一个更贴近决策的问题:看到当前离线变化后,真实线上效果不为正的概率有多大?只有当这个概率低于团队预设的风险上限,系统才直接上线;反方向足够明确时,可以放弃改动;中间地带仍然进入 A/B 测试。
论文的客服 AI 示例把可接受风险设为 10%。在其设定的参数下,理想化的 oracle gate——假定真实总体参数已知的门控——可直接上线约 14% 的改动,放弃约 6%,其余继续测试。这个数字只是特定示例的运行结果,不是通用比例。
现实里,参数也要从有限的历史改动中估计。论文的模拟显示,经过噪声修正的估计能消除大部分衰减,但在噪声较大、历史改动较少时仍会出现有限样本偏差。尤其麻烦的是,门槛估低会把本该测试的改动直接送进生产环境;门槛估高通常只是多做一次实验。两种错误的代价并不对称。
自动评分员还可能把方向判反
抽样噪声只是问题之一。LLM judge 还可能带来系统性偏差。
如果评分员对实验组和对照组同样准确,离线效果只会被统一放大或缩小;在论文给出的条件下,方向仍可保留。但如果它对两组的敏感度或特异度不同,结果就不再是简单缩放,甚至可能把真实的正向改善判成负向变化。
这类偏差不能靠增加题目数量解决。多测一些,只会让错误答案看起来更精确。因此,团队不仅要验证评分员总体上是否接近人工判断,还要检查它是否以不同方式对待新旧版本。
183 项改动全部进入 A/B 测试
论文用 Upworthy Research Archive 做公开示例。该档案包含 32,487 个美国媒体实验;论文从其中 4,873 个探索性实验出发,移除已记录的随机化故障期间创建的 1,050 个实验,再设置曝光量门槛,最终分析了来自 183 次测试的 183 项独立改动,分属 10 类标题特征变化。
这里的离线评测让 GPT-4o-mini 给标题的信息清晰度打分,线上结果则是点击率。两者测量都较精确,但论文报告,合并后的离线—线上关系较弱。各类别只有 9 至 27 项改动,类别内估计仍属探索性。按论文设置的示例门控,直接上线所需的离线提升超过了评分可能达到的最大变化,因此 183 项改动全部被送入 A/B 测试。
这个结果更像一次“安全关闭”演示:证据不够,门控便不替团队冒险。它不等于论文证明所有离线评测都不能支持上线。Upworthy 测的是新闻标题或图片带来的点击变化,也不是真实 LLM 产品发布日志;而且这里的评测目标是标题信息量,线上目标是点击,两者本就存在错位。换一套评分标准、业务指标、干预类别或统计模型,结果可能不同,但仍需针对那一类改动重新验证。
为什么上线后还要故意做实验
这项工作的另一个提醒很容易被忽略:门控一旦投入使用,就会改变团队能看到的数据。
直接上线的改动不再做 A/B 测试,被直接放弃的改动也没有线上结果。于是,团队只能继续观察处在“需要测试”区域的案例。即使离线评测与线上结果的关系在直接上线区域悄悄失效,剩余实验数据也可能看起来一切正常。
论文建议做 randomized audit experiments,即随机审计实验:从原本会直接上线或放弃的改动中随机抽取一部分,仍然进行 A/B 测试。这样才能持续获得门控关键区域的真实标签,发现关系漂移。换句话说,离线评测即使有资格替代一部分实验,也不能让线上实验彻底消失。
局限与未知
- 闭式门控依赖二元正态、测量方差可靠、误差结构合适等假设;它给出的风险界限不是脱离模型条件的安全保证。
- 最强的前提是历史改动与下一项改动可以互换理解,即它们来自同一类稳定关系。混合不同类型的改动,可能制造出看似很强的代理关系。
- Upworthy 只是公开数据上的示例,不能独立证明该方法适用于真实 LLM 产品;论文也把弱分布假设、分布漂移和审计比例列为待解决问题。
这篇论文最有价值的地方,不是给出了一条万能上线门槛,而是把证据标准摆正了。离线评测与人工一致,只能说明它可能是把不错的尺子;要让它替代 A/B 测试,还必须证明这把尺子测到的变化,能在同类产品改动中预测真实结果,并且这种关系在部署后仍能被持续检验。