一份金融分析写得流畅,不代表判断可靠。模型可能带着偏见,也可能一本正经地编造依据。过去的审计多盯着最终答案;Risk.net 介绍的这项工作则试图打开过程,追查哪些内部信号促成了这些输出。
作者 Hariom Tatsat 与 Ariye Shater 把机械可解释性用于 Gemma 2 和 GPT OSS。机械可解释性,就是检查模型内部的神经元、激活和信息路径,寻找某种行为是怎样形成的。他们尝试识别、监测并引导“内部特征”——模型中间层里可能对应情绪、概念或行为倾向的数值模式,并考察偏见、幻觉、情绪和交易设置。意义在于,金融机构未来或许不只能够发现模型答错,还能定位风险信号,并尝试干预。现有供稿未披露具体实验设置、效果数字和干预成功率,因此这项工作的实际审计能力仍无法据此判断。