你让AI修改一套代码,它不能只给几段建议。它得读懂仓库,调用终端,改文件,运行测试,再根据报错继续修。这类能把目标拆成步骤、调用工具并依据结果行动的AI,就是Agent(智能体)。7月31日开放API公测的DeepSeek-V4-Flash-0731,重点正是让模型从“会回答”走向“能办事”。
但“V4正式版来了”只说对了一半。本次更新仅涉及V4-Flash API;V4-Pro API以及APP、WEB端模型都没有更新,Pro正式版也只有“尽快发布”的说法。与本刊8月1日的进度相比,新的变化是DeepSeek Harness已开始小范围招募开源开发者内测,不过仍未公开上线。
骨架没换,重新教它怎么干活
V4-Flash-0731沿用预览版的模型结构和参数规模:采用MoE(混合专家)架构,总参数2840亿,每次处理任务时激活其中130亿,并支持1M上下文。MoE可以理解为一个拥有许多专业小组的团队,每次只叫最相关的几组参与,不必让所有参数同时工作。
这次升级主要来自重新后训练——模型完成大规模预训练后,再通过示例、反馈或强化学习调整行为的阶段。换句话说,DeepSeek没有换掉模型的“身体”,而是重新训练它如何修改代码、调用工具和连续完成任务。
官方公布的九项评测全部指向Agent、代码或自动化工作。较有代表性的几项是:Terminal Bench 2.1得分82.7,考察终端操作;DeepSWE得分54.4,考察软件工程任务;Toolathlon Verified得分70.3,关注工具调用。另有NL2Repo 54.2、Cybergym 76.7、Agent Last Exam 25.2、Automation Bench Public 25.1、DSBench-FullStack 68.7和DSBench-Hard 59.6。官方称,这组成绩整体显著超过Flash Preview和V4-Pro-Preview。
这些数字说明新版在特定测试中进步明显,但不能直接翻译成“全面追平顶级闭源模型”。相关跑分来自DeepSeek自报,而且有报道指出测试采用自研DeepSeek Harness的极简模式;执行框架、推理档位和Token预算都可能影响成绩。
接口也是产品的一部分
这次更值得注意的,可能不是某一项跑分,而是V4-Flash首次原生支持Responses API,并针对Codex做了适配。
Responses API是OpenAI推出的统一模型交互格式,可以在一次工作流里承载模型回复、工具调用及其结果,并衔接会话状态。对开发者来说,这像是插头规格对上了:原本围绕这套接口搭建的Agent工具,接入DeepSeek时可以少做一层改造。
再往外一层是Harness——把模型连接到代码仓库、终端和测试工具的执行框架,相当于给会写代码的模型配一张工作台。同一个模型换一套工作台,最终完成任务的能力也可能不同。DeepSeek Harness目前只启动了面向开源开发者的小范围内测招募,尚未公开发布。因此,眼下已经交付的是模型API和接口兼容;自有执行框架仍是下一块拼图。
这三层放在一起,方向就很清楚:DeepSeek不只想提供一个被其他产品调用的模型,还在争取开发者搭建Agent时采用的接口和执行入口。
外部评测给了部分佐证
Artificial Analysis的Intelligence Index给V4-Flash-0731打出50分,比4月版Flash高10分、比V4-Pro高6分,与GPT-5.6 Luna的51分相差1分。该机构还测算,即便Luna降价80%,V4-Flash-0731自有API的单任务成本仍低约60%。不过,这仍是特定综合评测和成本模型下的结论。
Arena.ai测试的则是最高推理档位DeepSeek-V4-Flash-High。它在Frontend Code Arena获得1586分,总排名第7、开放类别第3,较High Preview提高154分,较V4-Pro-Preview提高121分。这个结果支持其前端代码能力提升,但不能无条件代表所有API默认档位或其他任务。
真实使用的个案也呈现相似但更克制的图景。《每日经济新闻》采访的一名开发者称,同一任务中,V4-Flash配合Hermes约用40秒,GPT-5.6 Sol配合Codex用时1分47秒,但后者输出质量更高。另一项文件阅读和全网检索汇总任务消耗约51万Tokens,账单为0.53元。这些体验没有统一环境和重复实验,只能说明低成本Agent已经具备可用性,不能当作普遍性能结论。
生态侧已经开始行动。国家超算互联网已上线V4-Flash-0731,提供API调用服务和模型文件;网易有道称LobsterAI、有道词典、有道翻译、有道AI同传、Hi Echo、有道AI答疑笔和ThinkFlow已经接入。
局限与未知
- V4-Pro正式版、APP和WEB端更新仍未到来,所以这次不是整个V4系列的完整交付。
- 官方九项跑分与外部榜单采用不同框架、档位和任务,现有证据只支持“部分Agent与代码基准接近旗舰”,不支持全面追平。
- DeepSeek尚未披露本轮后训练的具体方法;Harness也仍处于小范围内测。模型进步有多少来自模型本身、有多少来自执行框架,目前无法拆开判断。