你让 AI 修改一大段方案,它也许很快就开始回答,但完整结果仍要一行行往外冒。短答案还好,长报告、连续对话或需要反复操作的 Agent——能代替人执行多步任务的 AI 系统——就会把生成时间变成明显的等待。
OpenAI 现在为 GPT-5.6 Sol 增加了一个更快的运行档位。按照官方博客的说法,新 API 服务层级 Ultrafast 在峰值情况下可达到标准处理速度的 14 倍,最高每秒生成 750 个输出 Token,并由 Cerebras 提供算力支持。不过,这些数字目前都来自 OpenAI 的发布信息,尚无独立测试或客户实测交叉验证。
快的不是训练,而是回答
Ultrafast 是一个服务层级,也就是同一模型按速度、容量、可靠性或价格划分出的不同运行档位。它没有重新训练 GPT-5.6 Sol,提升的是推理速度——模型训练完成后,接收输入并生成答案的运行过程。
这里最关键的指标是“输出 Token/秒”。Token 是模型处理和生成文字时使用的文本片段;输出 Token/秒衡量的是答案连续生成的速度。数字越高,长回答吐完得越快,交互式 Agent 在多个步骤之间等待的时间通常也越短。但它不表示答案更聪明,也不能直接说明答案质量更高。
OpenAI 给出的峰值是每秒 750 个输出 Token,并称 Ultrafast 可让 GPT-5.6 Sol 达到标准处理速度的最高 14 倍。两个限定词都不能省:“最高”意味着这不是稳定速度或平均速度;“输出”意味着它衡量的是答案生成阶段,也没有覆盖从提交请求到模型开始回答的全部等待时间。
Cerebras提供了什么
这次合作把 Cerebras 的替代算力路线推到了台前。Cerebras 以大型晶圆级 AI 芯片和配套计算系统挑战传统 GPU 路线,在 Ultrafast 中承担高速推理的基础设施角色。
所谓晶圆级引擎(Wafer-Scale Engine),可以粗略理解为把接近整片晶圆做成一颗超大型处理器。它的思路是减少不同芯片之间搬运数据的开销。对连续生成文本的模型来说,计算之外的数据移动也会占用时间,因此这种硬件路线适合被用来追求更高的生成速度。
但“由 Cerebras 支持”不等于“14 倍增益全部来自 Cerebras 芯片”。服务速度还可能涉及硬件、软件和调度等环节,而现有材料没有拆分各部分贡献。更准确的说法是:OpenAI 确认 Ultrafast 使用了 Cerebras 提供的算力,双方的合作由此公开浮出水面。
为什么每秒750个Token值得看
过去,想获得更快的实时响应,通常意味着选择更小或更专门的模型。OpenAI 对 Ultrafast 的定位,是让前沿模型也进入超高速生成区间,追求其所称的“每秒完成更多有用工作”。这是官方定位,目前还不是经过实际业务验证的结论。
速度真正有价值的地方,不只是让聊天窗口少等几秒。OpenAI 列出的潜在场景包括事故响应、客户服务与支持、金融市场分析和电子商务。这些任务往往要求系统连续读取信息、生成判断或执行多步操作。每一步都缩短等待,完整工作流才可能更接近实时。
不过,Ultrafast 目前仍处于 preview,也就是面向正式开放前的预览阶段,只提供给少量客户。OpenAI 表示会随着容量增长扩大访问范围。因此,这更像一次算力路线和服务能力的展示,还不能视为已经全面上线的标准体验。
局限与未知
- OpenAI 没有披露测试任务、输入长度、并发量、首个 Token 延迟、基准服务层级或统计方法,因此无法判断普通请求能多常触及 14 倍和每秒 750 Token。
- 现有材料没有价格、容量和可靠性信息,也无法判断企业为了速度需要付出多少成本。
- 性能数字和应用效果均缺少独立测试;目前能确认的是 Ultrafast 的官方峰值口径及 Cerebras 的算力支持,不能据此推断答案质量提升或所有场景都能稳定提速。