Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.064 — 2026-09-06
NEWS 约 1 分钟

A/B测试未必该五五分流

实验组更贵时,按成本与波动重新分流,可能比五五开省下预算。

IMAGE — Towards Data Science

给一半用户新功能、另一半旧功能,是 A/B 测试最常见的做法。但如果新功能每用一次都要调用付费 LLM,实验组显然更贵。此时继续五五分流,未必划算;简单地让“成本翻倍、流量减半”,也不一定是最优解。

Alejandro Alvarez Perez 提出的思路,是把每位用户带来的估计精度和入组成本放在一起算。流量分配——决定多少人进入实验组或对照组——既影响总支出,也影响结果中的噪声;最佳比例还取决于两组结果本身的波动。分流不均后,可以用逆概率加权,也就是按用户入组概率的倒数校正样本,让比较仍对应目标人群。作者称,合理设计可节省约 5% 至 15% 的预算,同时维持所需精度。

这不是无条件的“免费午餐”:比例越悬殊,加权后的估计通常越不稳定,实际实验还受上线速度和业务激励约束。更准确的结论是,五五开只是方便的默认值;当折扣、返现或 AI 调用让两组单人成本明显不同时,值得先算一遍成本与精度的账。


供稿材料 SOURCES — 1

← 返回 2026-09-06 · 数据板块