你让 AI 帮公司做一份报告,真正影响账单的,不只是它答得好不好,还包括要思考多久、调用多少次工具,以及整项任务能否少走弯路。OpenAI 推出的 GPT-5.6,正试图把这些问题合在一起回答:旗舰模型的竞争,不只拼最高能力,也开始拼完成真实工作时的成本与效率。
三档模型,一套效率叙事
据 OpenAI 介绍,GPT-5.6 系列已于 7 月 9 日全面可用,包括旗舰型号 Sol、面向日常工作的 Terra,以及成本最低、更加轻量的 Luna。三者可通过 ChatGPT、Codex 和 OpenAI API 使用;Pro、Business 与 Enterprise 用户还能选择型号并设置“推理强度”——也就是允许模型在回答前投入多少计算。投入更多计算,复杂任务可能做得更好,但通常也更慢、更贵。
OpenAI 将这次发布概括为兼具“frontier intelligence”和“frontier efficiency”,即前沿能力与前沿效率。官方称,GPT-5.6 在模型、推理和 Agent 工作流三个层面改善效率,目标是提供更多“每美元智能”——单位成本可以买到多少有效任务能力。
这里的 Agent 工作流,是让模型连续规划、调用工具、检查结果并完成多步任务。它更像请人办完整件事,而不是只问一个问题。因此,总成本不仅取决于单次回答价格,也取决于模型是否会反复尝试、调用多少工具,以及多久才能交付可用结果。
性价比成为主战场
OpenAI 还称,较小的 Terra 和 Luna 在其比较中,能以约十六分之一的成本超过 Anthropic 的 Fable 5。不过,这仍是官方自己的比较,材料没有给出测试条件和完整成绩,不能据此认定其已获得客观的成本优势。
本刊 7 月 14 日曾报道 Ploy 对 GPT-5.6 Sol 的小样本生产测试:网站构建更快、单次成本更低,但旧评测系统也难以适应并行工具调用。7 月 20 日,我们又讨论了 Sol 参与数学证明的案例。如今看完整产品线,OpenAI 的信号更清楚:模型竞争正在从单项榜单,转向能力、推理费用和整条任务链效率的综合账本。
局限与未知
- 现有论断均来自 OpenAI,缺少第三方评测或客户案例交叉验证。
- 官方没有披露价格、基准成绩、效率提升比例及完整测试条件。
- 因此,“更强”和“更具性价比”目前更适合作为产品定位,而非已经证实的结论。