想象用隔壁街区的数据预测你家附近的环境:两处本来就很像,模型答对并不稀奇。空间机器学习如今能方便地把实地观测与遥感、气候、地形等数据拼起来,生成环境地图;真正难的是判断它到了陌生地区还能不能用。
Jakub Nowosad 等人在发表于《Erdkunde》的论文中指出,普通的随机验证可能把相邻地点分到训练集和测试集。由于空间自相关——邻近地点的环境条件通常更相似——模型可能只是借附近信息答题,形成“空间泄漏”,让分数高估真实的跨地区能力。作者建议让验证方式贴近实际用途,例如按地区或空间区块隔开训练与测试;如果目标区域的气候、地形等条件超出训练数据覆盖范围,也应识别并标出模型不适用的区域。
这项工作的提醒很朴素:一张地图是否可信,不能只看一个漂亮的总体分数。误差分布、空间模式、不确定性,以及数据和软件流程能否复现,都应一起交代。论文没有在这篇供稿中给出单一算法的效果数字;重点是把评估设计本身视为预测质量的一部分。