你让 AI 一边查资料、一边运行代码,过一会儿再回来接着做。后台面对的就不再是一次问答,而是一项会反复行动、长期保留现场的任务。Agent(智能体)会连续调用模型和外部工具,并根据结果继续行动;为普通聊天设计的服务系统,因此可能找错真正的瓶颈。
作者用 AgentSysBench——统一测量 Agent 应用耗时与资源消耗的工具——研究了 10 类应用。最值得注意的是,半数应用的主要延迟来自工具或运行环境,而非大模型;单个会话的沙箱工作内存峰值可达 28 GB。生产记录还显示,会话可能停等数分钟到数小时,却仍要保留状态。换句话说,只把模型推理做快,并不能解决全部等待和资源占用。
作者据此主张,系统应同时调度模型、工具、环境和会话状态,并区分“任务结束”与“暂时等待”。这些结论来自其受控实验及三类应用的生产记录,能否推广到更多真实服务仍待验证。