Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.086 — 2026-09-28
PAPER H 42 约 1 分钟

合规评分也需要置信区间

AI合规分不能只报一个数:同批样本算出的多项指标会一起波动,门槛判断也该带上不确定范围。

一套 AI 拿到 82 分,合规门槛是 80 分,看起来已经过关。但换一批测试样本,分数可能变成 79。只报一个点估计——也就是用单个数字概括测试结果——会把这种摇摆藏起来。当可信度分数开始影响采购和合规声明,这个问题就不再只是统计细节。

Sokolov 等人给 SAFE AI 合规分补上了“不确定性层”。这套评分把准确性、可解释性和稳健性压成一个总分。关键在于,三项指标来自同一批测试数据,误差会一起变化,不能默认彼此独立。作者用配对 bootstrap——反复抽取同一组测试行,并在每次抽样中同时重算三项指标——估计它们之间的完整协方差,再生成联合置信区域和总分的置信区间。

最值得注意的结论是:忽略指标间关联,并不总会让结果显得更乐观。论文在真实与模拟数据中发现,独立性假设既可能缩窄,也可能放宽置信带,方向取决于汇总方式、模型和扰动类型。说白了,若区间跨过合规门槛,就不该把一次总分包装成稳固的“通过”或“不通过”;作者因此建议把这一区间记录进正式的不确定性证书。


供稿材料 SOURCES — 1

← 返回 2026-09-28 · 数据板块