想象银行让 AI 读取借款人的财务报表、查找第三方研究,再起草信用备忘录。旧验证表的第一问却是“请提供开发样本”:银行看不到供应商的训练数据,也无法重新训练模型。过去那套复核固定预测公式的办法,到了会生成文本的系统面前,第一步就卡住了。
Ananya Bhattacharyya 提出的关键转变是:验证工作要从“复刻模型”转向“设计测试”。生成式 AI 对同一问题可能给出不同答案,因此不能只验一次,而要重复测试错误率和波动;信用备忘录写得流畅也不算过关,还要逐项确认事实能否追溯到可靠来源。作者给出的框架包括按风险分级、按实际结果评估、测试稳健性,以及监控不易察觉的性能漂移。
这套思路也适用于医疗摘要、法律检索和客服机器人等高代价场景。人在回路——由专业人员审核、修改或否决输出——可以降低风险,但审核责任、证据展示和升级流程都必须明确。