像把同一段录像拆成照片,再随机分成练习题和考试题:考生在考场里遇到的,几乎都是练习题的相邻画面。分数再高,也不代表它会做真正的新题。Ramandeep Singh 的实时跌倒检测器就踩中了这个坑:模型根据摄像头提取的人体骨架特征,逐帧判断是否跌倒;最初随机切分视频帧后,准确率达到94.3%。
问题在于,相隔80毫秒的两帧几乎一样。训练集和测试集——前者供模型学习,后者检验它面对新数据的表现——因此混入了大量“近邻”。这属于数据泄漏:模型间接见过测试信息,像提前看过考题。作者保持特征和模型不变,改用 GroupKFold 按完整视频分组,确保同一录像不会同时出现在训练与测试中,准确率随即降至69.1%;其中一折甚至只有31%。这些结果来自作者自述,但提醒很直接:面对视频、传感器或时间序列,先检查数据是否按人员、设备或完整事件切开,再讨论模型成绩。