你让 AI 一边看界面截图,一边修改代码,再连续调用工具排查问题。难点不只是“会不会答”,还在于它能否记住漫长流程,又不让计算成本一路上涨。8 月 26 日发布的 GLM-5.3-Flash,瞄准的正是这类任务。更受关注的是,此前以匿名身份接受测试的 Ox Alpha,如今揭面为这款模型。
这次进展把几条线串了起来:新模型正式发布,社区开始讨论部署与量化,官方权重也已进入 Hugging Face。至于“性能更强、价格仅为前代十分之一”等说法,目前主要来自 Z.ai,尚缺材料中的第三方复测;主编提到的 OpenRouter 用量暴涨 1270%,供稿也没有给出流量时间序列,因此本文不把它写成已核实结论。
匿名模型终于有了名字
我们 8 月 23 日报道 Ox Alpha 时,它还是身份未定的匿名测试模型,社区猜测它可能来自 GLM 或 MiMo。OpenRouter 如今明确写道,Ox Alpha 已揭面为 Z.ai 的 GLM-5.3-Flash;Reddit 的 LocalLLaMA 讨论帖也以“former ox-alpha”为题集中整理发布信息。谜底由此基本落定。
这不仅是一次改名。GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型。所谓原生多模态,是指模型从设计和训练阶段就统一处理文字、图像等信息,而不是临时在外面接一个图片识别器。Hugging Face 官方模型页给出的示例,也展示了图片与文字可以一起输入。
长任务,少算一点
模型采用 Hybrid Sparse + Linear Attention,也就是把稀疏注意力与线性注意力混在同一套架构里。注意力可以理解为 AI 阅读材料时标记“哪些内容彼此相关”的机制。普通做法面对很长的输入,计算负担容易迅速增加;稀疏注意力只查看部分关键关联,线性注意力则试图让计算量不要随文本长度急剧膨胀。
社区汇总与官方模型页显示,GLM-5.3-Flash 共 320B 参数,但每次推理只激活 18B。它有 45 层,其中 34 层使用 KDA linear attention,11 层使用 sparse attention;预训练材料规模为 30T token,并包含多模态数据。这里的 token 是模型处理文字或其他输入时使用的基本单位。
OpenRouter 将其上下文窗口标为 1M token。上下文窗口就是模型一次能够放在“工作台”上的信息量。它适合长周期 Agent 任务——让 AI 长时间保存目标和中间状态,持续规划、调用工具并修正结果,而不只是回答一次问题。不过,窗口足够长不等于执行一定稳定,两者仍需分别检验。
Flash 的重点是成本与部署
GLM-5.3-Flash 是开放权重模型:用户可以下载训练完成后的参数,自行部署、量化或微调,但这不等于训练数据、训练代码和完整开发过程全部开源。官方权重已经发布到 Hugging Face,主仓库提供 FP8 版本,另有 BF16 版本。两者是不同的数值精度格式,通常会影响部署所需的硬件资源与计算表现。
价格也解释了“Flash”定位。OpenRouter 标示的常规价格为每百万 token 输入 0.15 美元、输出 0.50 美元、缓存读取 0.03 美元。ZAI 的限时五折持续到 2026 年 9 月 9 日 16:00 UTC,期间对应价格为 0.075、0.25 和 0.015 美元。
OpenRouter 页面一度显示,最佳服务商的 P50 吞吐量为每秒 91 token,延迟为 0.80 秒。P50 即中位数:一半观测高于它,一半低于它。但这些是平台在特定阶段、特定服务商下的动态观测,不是模型固定不变的速度。
为什么值得继续看
Z.ai 宣称,这款模型以 GLM-5.2 十分之一的价格取得更高性能,并在 coding 与 agentic benchmarks——编码和自主执行任务的标准化测试——上接近 Claude Opus 4.8。这个定位很清楚:不只追求更高分,也试图降低长上下文、多模态和连续工具调用的实际成本。
对社区而言,开放权重让讨论不必停在厂商 API 页面。开发者可以自行运行模型,检查量化后的表现,也能复核它在真实编码和长流程任务中是否稳定。这比一次匿名榜单亮相更有后续价值。
局限与未知
- “超过 GLM-5.2、接近 Claude Opus 4.8、价格仅为十分之一”均主要是 Z.ai 的自述。材料没有提供完整评测表、统一测试条件或独立复测。
- OpenRouter 的价格、吞吐量和延迟会随促销、服务商与路由变化,不能视为模型的永久属性。
- 供稿没有提供 OpenRouter 用量增长 1270%所依据的时间区间和原始数据,本文无法核验这一数字。