你让 AI 处理 1000 张客服工单。它答得准、会查账单系统,也能把多数问题办完。工程团队看到一排绿色指标,以为可以上线;财务却算出,这套流程比全部交给人工更贵。问题不在 AI 会不会做,而在每成功办成一件事,到底花了多少钱。
这是 Pratik Rupareliya 讲述的一个匿名 SaaS 公司案例。全部数据与趋势判断均来自作者自述,未获独立信源交叉验证。
十二项指标全绿,为什么还不够?
这家公司用 AI Agent 处理账单和账户工单。AI Agent 不只生成回复,还会调用搜索、数据库或业务系统,分多步把工单真正结案。
作者称,公司采用了他此前发布的十二指标评测框架。所谓评测框架,就是用固定样本和指标反复测试系统。它检查任务完成、事实可靠性、检索精度、工具调用准确性、延迟和幻觉率等问题,也能发现错误检索、工具参数填错、推理循环停不下来或偏离用户意图等故障。
在该框架跟踪的指标上,这个 Agent 全部进入目标区间;作者还称,它处理相同类型工单时比人工团队更准确。但这些都是质量指标,只回答“做得对不对”,没有回答“做得值不值”。
财务算的是整张工单
作者给出的数字经过取整,但计算结构保留了下来:Agent 每次尝试的完整推理、工具调用、重试与最终整理,平均花费约 3.40 美元。它成功解决 71% 的工单,其余 29% 尝试后转给人工。
以 1000 张工单计算,Agent 先尝试全部工单,花费 3400 美元;290 张失败工单再由人工处理,按每张约 4.20 美元计算,又花费 1218 美元。总成本是 4618 美元。若从一开始全部交给人工,则为 4200 美元。按作者的测算,Agent 辅助流程反而贵了约 10%。
关键口径叫“每次成功结果成本”:把产生成功结果所需的全部成本,加总后除以成功次数。只看单次尝试,数字是 3.40 美元;把失败尝试的消耗也摊入 710 次成功结案,成本就变成:
相比人工的 4.20 美元,每次成功结案贵 0.59 美元,而且这里还没有把转人工工单上的重复付费算进这一比较。
Token 降价,不等于任务变便宜
作者认为,2026 年单个 token——模型处理文本时使用的计费单位——价格仍在下降,但 Agent 完成一张工单通常不只调用一次模型。它可能先规划,再多次调用工具,经过几轮推理、自我检查和失败重试,最后才整理答案。单价下降的同时,每次结案消耗的调用和计算可能增长得更快。不过作者没有提供支持这一趋势的具体数据或外部来源。
这也是单位经济值得单独评测的原因。单位经济,就是把全部收入和成本摊到一次任务上,看这件事是否合算。一个 Agent 可以准确、稳定,也可以在每完成一项工作时持续多花钱。质量评测与财务判断并不矛盾,它们只是回答了不同问题。
为什么值得关注
这个案例提醒团队,生产评测不能停在模型表现。真正需要比较的是端到端业务流程:成功任务承担了多少模型调用、工具调用、失败重试和人工接手成本。否则,仪表盘可以全部显示绿色,财务账面仍然是红色。
局限与未知
- 这是作者提供的匿名个案。公司名称、样本量、观察周期及十二项指标的完整清单和阈值均未披露。
- 文中的成本数字经过取整,人工复核、基础设施、部署摊销和异常升级是否全部计入,材料没有说明。
- 该案例不能证明 Agent 普遍比人工更贵;它只说明,准确率较高和单位成本更低是两件不同的事。