让 AI 连续写八小时代码,真正烧钱的往往不是“答一句”,而是反复把代码、日志和操作历史重新读一遍。一名 Reddit 用户把 Qwen3.8-27B 接入 DeepSeek Harness——一套让模型读写文件、运行命令并多轮修正的 Agent 工作台——完成了一次八小时以上的本地任务,并称因此省下逾 650 美元 API 费用。
按其记录,这次运行共调用模型 966 次,处理约 1.302 亿输入 token、生成 81.25 万输出 token;每输出 1 个 token,约要送入 160 个。请求的上下文中位数达 13.66 万 token,最大 23.12 万,说明长任务的主要负担是反复处理历史,而非生成答案。系统完成 1,421 次本地工具操作,模型生成零失败,加权生成速度为每秒 104.83 token。代价也很直观:双 Agent 共用一个推理端点时,排队和读取长上下文会显著拉长等待。以上均为发帖者自报,摘要未给出云端模型、计价方式及本地硬件折旧和电费,因此“省 650 美元”更适合作为个人账本参照,而非通用成本结论。