你请 AI 批量处理客服记录,账单不只取决于它“聪不聪明”。读进去多少文字、生成多少回答、为了完成任务要调用几次,以及每次等多久,都会变成成本。现在,OpenAI 一面下调 GPT-5.6 的价格,一面称其中的 Sol 已参与优化承载自身运行的系统。值得看的不只是一次促销,而是模型竞争开始落到更具体的问题:每一美元到底能完成多少工作。
Token 是模型处理文字时使用的基本计费和计算单位,大致可理解为切分后的字词片段。AI API 通常分别计算输入和输出 Token。以下价格、性能和内部使用数据主要来自 OpenAI 及其负责人披露;相关效率改进有媒体交叉转述,但没有独立实验验证。
降价先落到账单上
据 OpenAI 官方博客及 Sam Altman 发布的信息,GPT-5.6 Luna 的价格下调 80%,现在每百万输入 Token 为 0.20 美元,每百万输出 Token 为 1.20 美元。Terra 降价 20%,输入和输出价格分别为每百万 Token 2 美元和 12 美元。
Sol 则在 API 中增加 Fast mode。官方称,它最高可达到原来 2.5 倍的速度,价格为 2 倍,并保持相同的智能水平。这个选项卖的不是便宜,而是时间:企业可以多付一些钱,换取更快返回。不过,“智能水平不变”目前只是官方表述,材料中没有第三方评测。
本刊此前报道 GPT-5.6 时,已经把模型能力、推理费用和 Agent 整条任务链的效率放在同一张账上。Agent 是能连续调用工具、分多步完成任务的 AI 系统。今天的新信息,是价格已经具体下降,而且 OpenAI 披露了 Sol 如何参与压低运行开销。
模型开始给机房“拧螺丝”
OpenAI 称,Sol 部署后被用于改进承载自身运行的系统。它会分析真实生产流量、调整请求路由,并改写 Triton 和 Gluon Kernel。GPU kernel 是在 GPU 上并行执行的底层计算程序,像一套直接指挥硬件干活的操作步骤;把步骤排得更紧凑,同样的运算就可能少占一些硬件时间。
据 OpenAI 披露,生产 GPU kernel 的改进使服务成本降低 20%。这里必须收窄理解:材料说的是 kernel 改进带来的服务成本变化,不能扩大成整个端到端系统已经便宜了 20%。
Sol 还参与优化推测解码。这个方法会先用更快的方式批量猜出候选 Token,再交给主模型验证。好比助手先拟一段草稿,负责人只需检查和修正,而不必逐字从头写。OpenAI 称,相关改进让 Token 生成效率提高了 15% 以上。报道还称,模型参与设计 draft model——负责先行猜测的“小模型”——并搜索部署参数。
不过,这还不是模型自主升级自己。整个流程仍是 human in the loop,也就是人类始终参与并掌握关键决定。优化什么、开放哪些工具、用什么指标评测,以及代码能否进入生产环境,都由人类控制。更准确的说法是:模型开始成为优化自身服务系统的工程工具,而不是已经形成不受控制的“递归自我改进”。
省下来的算力,很快又会被用掉
OpenAI 还把注意力放到 Agent 的循环开销上。复杂任务常反复经历“思考、调用工具、读取结果、继续思考”。单轮浪费不多,循环几十次后就会累积。
据相关技术报告的媒体转述,OpenAI 为此使用 Rust 编写 Agent Harness——连接模型、工具和用户环境的运行层。它不会一开始就把所有工具说明塞给模型,而是在需要时再展示;工具返回默认不超过一万 Token;上下文只在末尾追加,以提高 Prompt 缓存复用。Prompt 缓存就是复用已经计算过的相同文本前缀,避免每轮从头计算。
需求也在快速吞掉效率红利。据同一报道,GPT-5.6 内部测试期间,每名活跃研究人员的日均输出 Token,超过 GPT-5.5 时期峰值的两倍。过去半年,OpenAI 内部编程推理的研究算力占比增长 100 倍,内部 Agent Token 用量增长约 22 倍。这些数字不能证明研究效率同比增长,却说明模型更便宜、更易用后,调用量可能迅速扩大。
这正是此次变化最值得关注的地方。竞争不再只是回答排行榜上的题目,还包括能否改进底层程序、减少 Agent 的重复劳动,并把单位任务成本压低。能力仍然重要,但经济性正在变成另一条主赛道。
局限与未知
- 现有材料没有证明本次降价完全由 Sol 参与的效率优化促成,两件事只能说同期公布,不能写成确定因果。
- 成本、速度和内部用量数据主要来自 OpenAI 体系;Fast mode 的智能表现及整体性价比仍待第三方验证。
- 公开材料没有给出实验设计、统计口径和完整部署细节,因此无法判断这些收益在不同任务与负载下能否稳定复现。