你让 AI 修一个程序,它不能只给出几段看似正确的代码。它还得打开项目、找到问题、修改文件、运行测试,再根据报错返工。能把这条长链走完,才算真正“会干活”。7 月 31 日,DeepSeek-V4-Flash-0731 正式版 API 上线公测,升级重点正是这类 Agent 能力——Agent 指能拆解目标、调用工具并根据结果继续行动的 AI。
但“V4 正式版来了”只说对了一半。目前上线的只有 V4-Flash API。V4-Pro API、DeepSeek App 和网页端都没有更新,Pro 正式版也只有“尽快发布”这一模糊时间表。换句话说,开发者已经能试用新模型,普通用户今天打开 DeepSeek,体验仍和昨天一样。
本刊 7 月 20 日还在追踪 V4 的发布窗口,7 月 30 日又报道了 V4 与 Harness 的内测传闻。现在,Flash 确实从预告走到了产品交付,但整个 V4 系列还没有到齐。
身板没变,做事方式变了
这次更新最值得看的地方,不是参数又变大了。恰恰相反,据 DeepSeek 官方材料,V4-Flash-0731 与 Preview 版的模型结构和尺寸相同,只重新进行了后训练。
后训练可以理解为“入职后的专项练习”。模型先通过预训练获得基础知识,再用示例、反馈或强化学习,练习怎样服从要求、选择工具、发现错误并完成任务。它像同一个人换了一套更有效的工作方法:知识底子未必改变,做事的顺序和习惯却可能明显改善。
官方披露,V4-Flash 采用 MoE(混合专家)架构——每次只调动模型中的一部分“专家”参与计算;总参数为 284B,实际激活参数为 13B,并支持最长 100 万 token 的上下文。token 是模型处理文字时切分出的基本单位。不过,这些参数以及“仅重新后训练”的说法都来自 DeepSeek 同一份官方材料,具体训练数据、奖励方法和流程尚未公开。
官方成绩显示,DeepSWE 从 Preview 版的 7.3 升至 54.4,Terminal Bench 2.1 从 61.8 升至 82.7。前者考察代码 Agent,后者侧重模型能否操作终端并连续完成任务。另有 Cybergym 76.7、Toolathlon verified 70.3、DSBench-FullStack 68.7 等成绩。DeepSeek 称,Flash 正式版的 Agent 基准整体远超 V4-Pro-Preview。
这些数字可以说明新版在官方设定的工作环境里进步很大,却不能简单等同于“模型本体突然聪明了”。部分 Code Agent 测试使用了尚未发布的 DeepSeek Harness 极简模式,并采用 max 推理档位、top_p=0.95、temperature=1.0。Harness 是把模型连接到代码仓库、终端和测试工具的执行框架,相当于给编程模型配了一张真实工作台。最终成绩反映的是模型、推理预算、工具和框架的组合。
不只交模型,也开始交工作台
V4-Flash-0731 还原生支持 Responses API,并针对 Codex 做了适配。Responses API 是一套更适合 Agent 的通信接口,可以统一处理模型回复、推理状态、工具调用和执行结果。它本身不会让模型变聪明,但能减少接入编程 Agent 时的改造工作。
这也是此次更新比单纯“跑分上涨”更实在的部分。DeepSeek 过去因高性价比模型和开放权重受到关注,但模型能力只有接进真实软件流程,才会变成开发者可用的产品。Flash 现在同时补上了后训练、接口适配和 Harness 运行环境这三块,说明 DeepSeek 正把注意力从“模型答得怎样”移向“任务能不能交付”。
第三方观察提供了一点侧面证据。Artificial Analysis 给 V4-Flash-0731 的最高推理档位打出 50 分,同类可比模型中位数为 17 分;但该次评测生成约 2.1 亿 token,而可比模型中位数约为 6200 万。更高的推理消耗可能换来更好成绩,因此这组数字不能脱离计算量谈效率。爱范儿则用 5 项实际任务测试了首版交付,称总成本约 3 元,并认为已经有较高可用性;不过,5 个任务仍不足以代表模型的全部能力。
为什么说只来了“一半”
Flash 的交付证明,DeepSeek 至少已把一部分 V4 能力变成可调用的产品。真正的检验则还没结束:Pro 没来,App 和网页端没变,Harness 也未公开。所谓“V4 正式版”,目前准确含义只是“V4-Flash 的 API 正式版进入公测”。API 公测允许开发者开始调用,但不等于整个产品线已经正式交付。
这一区别很重要。模型发布不再只是发一张成绩表。Agent 要进入实际工作,模型、接口、执行框架和成本缺一不可。Flash 已经交出了其中一套组合;DeepSeek 能否完成整个 V4 产品承诺,还要看 Pro 和大众端何时到场。
局限与未知
- DeepSeek 没有披露后训练所用数据、奖励方法和流程,现阶段无法判断成绩提升分别来自哪些环节。
- Harness 尚未公开,DSBench-FullStack 和 DSBench-Hard 又是内部测试集,外部还不能完整复现官方结果。
- Pro 的确定发布日期仍不存在。“8 月初”等说法来源不明,官方目前只承诺“尽快发布”;不同版本的 Terminal Bench 也不能直接横向比较。