个人用 AI 写代码,订阅费看着不高;全公司铺开后,账单却会被大量模型调用迅速放大。尤其是 Agentic coding——AI 会自己拆任务、读写文件、运行工具并反复修改项目——每多走一步,都可能消耗更多 Token,也就是模型处理文字和代码的计费单位。Databricks 团队称,这类工具提升了其跟踪的各项开发速度指标,但规模化成本也在快速增长。
这篇文章给出的最大成本杠杆,不是限制员工使用,而是不断把日常任务迁到更高性价比的新模型。作者称之为“效率前沿”:在达到所需能力的前提下,找价格最低的模型。难点是公开榜单未必反映公司内部的真实编程任务,因此企业需要用自家工作负载做评测。文章举例称,Stripe 评估后认为 Opus 4.7 相比 Opus 4.6 没有明显提质、成本却更高,因此未向内部开放;Databricks 比较 Opus 5.0 与 4.8 时也观察到成本倒退。换句话说,新模型不等于更划算,规模化采购前要先算清真实任务中的质量与单价。文中结论来自 Databricks 自身经验及对 Stripe、Coinbase、Uber、Ramp 等公司的非正式交流,节省幅度仅具方向性。