你问 AI 客服:“开封商品超过 30 天还能退吗?”第一次答对,不代表它可靠;下一次,它可能漏掉例外,甚至承诺并不存在的退款。Nielsen Norman Group 的 Raluca Budiu 提醒,生成式 AI 带有随机性——同一输入重复提交,措辞和质量都可能变化。因此,一张漂亮结果图最多证明“它曾经做到过”,不能说明“它通常能做到”。
更像样的评估,应该接近一次定量用户研究:先准备覆盖真实场景、难度与风险的代表性任务集,再让系统对每项任务重复运行,统计平均成功率,同时报告置信区间——也就是用一个范围说明分数有多不确定。图示用 10 道题、每题 5 次运行举例:50 次回答中 40 次合格,成功率为 80%;但单看 80% 仍不够。
两套系统都可能得到 40/50:一套始终答不好同两道题,另一套则在所有题上随机失手。前者暴露固定短板,后者意味着用户无法预知哪次会踩雷。对设计团队来说,除了总分,还要查看失效模式——系统究竟怎样出错、后果是什么。文章给出的是评估原则与示意案例,并未披露可直接套用的样本量门槛。