同一位师傅,换三套工作流程,成品可能差不多,工时却能差出几倍。Reddit 用户 xquarx 用同一个 DeepSeek V4 Flash 底模——负责理解和生成代码的基础模型——测试 Claude Code、OpenCode 和 Pi,想看外围工具是否会改变编码表现。按作者自述,三者最终生成了相同的代码改动,质量基本一致,但 Claude Code 完成任务的时间接近最快方案的四倍。
差别出在“编码壳”:它包在底模外面,负责读取代码、调用工具和安排反复修正。作者观察到,Pi 更偏向先推理,OpenCode 会把任务分派出去,Claude Code 则花更多时间探索代码库。这些路径会改变工具调用次数、耗时和 Token 用量;Token 是模型处理文本的计量单位,通常也关系到调用成本。测试只覆盖作者自己的大型代码库工作负载,摘要未披露完整样本规模,因此更适合视为一个提醒:选编码 Agent 时,别只比较底模,外面的流程设计同样可能决定效率和账单。