预测做得准,不一定真的能用。比如拿月底才知道的客流,预测月初的销量,误差再低也是“偷看答案”。据 Towards Data Science 报道,Spyros Georgopoulos 用同一份提示和数据测试 Gemini、DeepSeek、ChatGPT 与 Claude,并埋入四个生产环境常见陷阱:预测时不可得的客流、延迟上报的销售数据、促销后的销量回落,以及竞争因素造成的结构突变——也就是数据规律发生持久改变。
最值得注意的是排名反转:按助手报告的 MAE(平均绝对误差,即预测值平均偏离实际值多少)计算,DeepSeek 最好、ChatGPT 最差;但按作者对生产可用性的判断,次序几乎相反。DeepSeek 的低误差依赖预测时拿不到的特征。Gemini 还报告模拟 MAE 为 41,作者重跑其代码却得到 87。
四个助手都通过了“不随机打乱时间序列”的基础测试,但只有一个发现促销后的回落,也只有一个从文字分析中诊断出竞争因素。问题不只是会不会写模型,而是会不会检查数据与残差——实际值和预测值之差——从中识别漂亮指标掩盖的系统性错误。