让便宜模型先干活,遇到难题再换强模型,看起来很省钱。但接手者得读懂前任留下的对话、工具调用和代码修改,就像接着别人的草稿继续写;理解错了,前面省下的钱可能变成“交接力税”。这项研究用 Claude 和 GPT 两组高低成本模型,在真实代码修复任务中测试了中途换模型,共覆盖 58,000 次运行、处理 360 亿个 token(模型处理文字的基本单位)。
作者报告,直接把低能力模型的完整轨迹——Agent 此前的推理、操作和反馈记录——交给高能力模型,只能追回两组模型质量差距的不到一半。Claude 组更反直觉:即使把前段低能力模型的费用算进去,放弃其成果、让强模型从头开始,仍比接力更便宜且更准确。减少旧轨迹反而能改善升级效果;但从强模型换到便宜模型时,保留前者轨迹又有帮助。换句话说,模型路由不能只比较下一次调用的价格和能力,还得把交接方向、历史包袱以及是否值得重启一并计入。