客服 Agent 每接一单,都可能重新琢磨一遍“先核实邮箱,再查账户”。这篇论文的想法是:别反复交这笔思考费,先把常见解法写成操作卡。作者收集同一领域35至50个任务的既有轨迹,让编码 Agent 分析成败案例,再浓缩成40至130行的“技能”——可复用的办事步骤,并放进非推理模型的系统提示,也就是每次任务开始前收到的高优先级说明。
最具体的例子来自零售客服:普通非推理模型在59%的训练轨迹里会捏造参数、过早调用身份验证工具,这一个问题占观察到的工具错误的94%。技能可以直接提醒模型避开它。作者报告称,在四个 Agent 基准的未见任务上,GPT-5.4-mini 借助技能补回了推理模式与非推理模式之间55%至超过100%的性能差距;在 ALFWorld 和零售任务上还超过推理模式,同时输出 token 少2.9至4.5倍,且不产生推理 token。不过,电信和表格任务仍留下差距,说明涉及具体实例的长依赖时,临场深思还不能完全被固定操作卡取代。