让 AI 写软件,难点不在补出几行代码,而在于它能否跨文件修改、运行测试,并确认结果真的可用。智谱(国际品牌 Z.ai)新发布的 GLM-5.3,正把重点放在这类编程任务和代码安全上。量子位报道称,它在多项基准中位居开源模型前列;提高 Token 预算——也就是允许模型在回答前使用更多内部步骤——后,编程准确率还会继续上升。
更具体的看点是安全审查。CyberGym 白盒代码审查——让模型直接阅读源代码并寻找漏洞——中,GLM-5.3 得分为 84.5%,高于 GLM-5.2 的 77.2%。据量子位报道,发布前的联合测试经初筛、去重后发现 2404 个漏洞,其中 1088 个属中高危,覆盖 220 个项目,最早的缺陷可追溯至 40 年前。这些数字仍来自发布方及媒体测试,不能替代真实项目里的人工审计,但它说明开源阵营又多了一个同时争夺编程与安全能力的选手。