Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.040 — 2026-08-13
NEWS 13 信源 约 6 分钟

DeepSeek V4 Pro:模型与Agent同时出牌

V4 Pro正式交付,Harness仍在内测:DeepSeek开始同时争夺模型能力与编程Agent入口。

IMAGE — DeepSeek (via Google News)

你让 AI 帮忙改一个项目,它不只要回答“这段代码哪里错了”,还得自己读取文件、调用终端、运行测试,再根据报错继续修改。模型像会思考的程序员,Harness——连接代码库、终端和测试工具的执行框架——则像它的工作台。DeepSeek 这次值得关注,正因为它同时推进了两件事:正式交付更偏能力的 V4 Pro,并把编程 Agent 产品线推入封闭内测。

这比单纯刷新一次模型版本更重要。竞争正在从“谁回答得更好”,延伸到“谁能把模型装进一套真正完成工作的工具”。不过,两条战线的成熟度并不相同:V4 Pro 已向开发者开放,Harness 还没有正式发布。

Pro终于交付,但不是整个V4一起升级

DeepSeek 官网 API 文档已经新增 DeepSeek-V4-Pro-0813。开发者仍可使用 deepseek-v4-pro 这一调用名,直接接入新版本。我们在 8 月 3 日的报道中只确认了 V4-Flash 正式落地,当时 V4 Pro 尚待发布;如今 Pro 才算完成正式交付。

Pro 和 Flash 面向的场景不同。同一模型家族里,Pro 通常更偏能力,Flash 更偏速度、成本和高并发,因此不能把 Pro 更新理解成整个 V4 系列同步升级。一个很直观的差别是,据智东西援引官方 API 文档,V4 Pro 的并发限制为 500,而 V4-Flash 为 2500。对于需要同时处理大量请求的服务,Flash 仍可能更合适。

新版本支持 JSON 结构化输出和工具调用。前者让模型按软件容易读取的格式交付结果,后者让模型按规定请求终端、搜索等外部能力。这些并不是显眼的聊天功能,却是搭建 Agent——能够调用工具、连续执行任务的 AI 系统——所需的接口基础。V4 Pro 还支持 Responses API 和 Anthropic API,方便开发者把它接入现有工作流。

DoNews 报道称,V4 Pro 同时提供非思考与思考两种模式。思考模式会在回答前投入更多计算处理复杂问题,通常可能改善结果,但也会增加等待时间和 Token 消耗。由于该报道注明内容由智能模型自动生成,这一信息目前仍是单一、证明力较弱的信源。

跑分变强了,但先别扩大结论

智东西给出的基准结果显示,V4 Pro 正式版在 Cybergym 和 AutomationBench 上超过 Claude Fable 5。前者是安全智能体测试,后者考察工作流智能体。在面向长周期、复杂软件工程任务的 DeepSWE 中,其得分从预览版的 12.8 升至正式版的 62.7。

这个增幅说明正式版至少在特定 Agent 测试中出现了明显进步,也解释了为什么这次更新要和编程 Agent 放在一起观察。但这些数字目前只有一个信源,材料中没有官方评测报告、测试配置或可复现实验。因此,更稳妥的说法是:V4 Pro 在部分 Agent 基准上超过 Fable 5,不能据此推导出综合能力已经全面领先。

真正的新战线,是模型之外

DeepSeek 官方招聘信息用一句公式概括这条路线:Model + Harness = Agent。模型负责理解和推理;Harness 负责把它连接到代码库、终端和测试工具,并组织任务执行。换句话说,同一个模型放进不同的工作台,最后能不能稳定改完代码,结果可能很不一样。

多家媒体交叉确认,DeepSeek 已组建 Harness 团队,相关微信公众号的认证主体为北京深度求索人工智能基础技术研究有限公司。团队正在研发代码智能体,并涉及桌面端 Agent,方向对标 Claude Code。负责人崔添翼此前公开招募内测用户,也表示团队人员紧缺。目前产品已经进入封闭内测。

这意味着 DeepSeek 不再只向开发者提供“模型大脑”,还在尝试控制模型如何读取项目、调用工具和完成任务的产品层。V4 Pro 增强工具调用,是给 Agent 准备能力接口;Harness 则负责把这些接口编排成可用产品。两者合起来,才构成对 Claude Code 更直接的竞争。

但“同时出牌”不等于“两款产品同时发布”。目前正式交付的只有 V4 Pro。Harness 的具体形态、发布日期和公开性能都没有确定。匿名内测者所谓“宇宙最强”或“吊打 Fable”的说法无法核验,也不足以作为产品能力判断。

为什么值得持续看

过去,开发者主要比较模型能否写出正确代码。进入 Agent 阶段,问题变成它能否连续工作:会不会选对工具,遇到报错能否回头修正,改完后是否主动运行测试。模型能力仍然重要,但产品体验越来越取决于 Harness 的工程质量。

DeepSeek 因此面对两场不同的考试。V4 Pro 要证明自己在复杂任务上的能力提升能稳定复现;Harness 则要证明它能把模型能力转化为可靠、易用的编程工具。前者已经开放 API,后者仍在封闭内测。现阶段最准确的判断不是 DeepSeek 已经完成转型,而是它已经把竞争边界从模型接口推向了完整开发工具链。

局限与未知

  • V4 Pro 的 Agent 跑分来自单一报道,缺少官方评测报告、测试配置和可复现实验。
  • API 价格存在冲突口径:有报道说尚未公布,有报道说未调价,也有报道说官网已经更新,现有材料无法确认。
  • Harness 尚未公开产品形态、发布日期和性能,封闭内测评价不能替代正式测试。

供稿材料 SOURCES — 13

← 返回 2026-08-13 · 科技板块