如果你让 AI 替你改代码、调用工具,再把一串任务从头做到尾,真正影响体验的往往不只是它会不会回答问题,而是能不能连续行动、少在中途掉链子。DeepSeek 现在把 V4 系列的旗舰版推到了台前:官方称 DeepSeek-V4-Pro-0813 已取代预览版,模型权重也已上线 Hugging Face;第三方 Unsloth 随后提供了 GGUF 量化版本,让本地运行多了一条现成路径。
这正好接上本刊 8 月 2 日留下的悬念。当时 V4 Flash 已开放权重和 API,V4 Pro 正式版仍未更新。如今 Pro 的模型制品已经出现。不过,“今日发布”的说法来自 DeepSeek 官方 X 帖文的 Reddit 转述,供稿没有帖文时间与时区,不能据此把“今日”严格落到某个绝对日期;型号中的“0813”也只能作为型号后缀看待,不能直接当作发布日期。
它到底新在哪?
DeepSeek 官方 Hugging Face 页面把 DeepSeek-V4-Pro-0813 定义为 V4 Pro 的正式版,并称它取代此前的 Preview。新版本沿用预览版的模型结构,同时接入 DSpark speculative decoding 模块。所谓“推测解码”,可以理解为先让一个机制快速打草稿,再由模型检查哪些内容可以采用,目的通常是加快生成。材料没有给出实际速度、延迟或成本数字,因此目前只能确认该模块存在,不能判断它究竟快了多少。
官方还把重点放在 agentic capabilities——也就是模型作为“智能体”拆解任务、调用工具并连续执行多步操作的能力。官方称这方面和整体性能都有“显著增强”,且生产环境中的提升尤其明显。但这些是发布方自己的表述,材料没有提供生产环境的定义、对比对象或独立测试,暂时不宜把它写成已经验证的结论。
公开成绩至少给出了一些可比较的坐标。按 DeepSeek 官方页面的数据,V4-Pro-0813 在 Terminal Bench 2.1 上得到 87.9,预览版为 72.1;在 NL2Repo 上从 38.5 提升到 61.5;DeepSWE 则从 12.8 升至 62.7。三项都指向代码智能体任务上的明显进步。不过,官方说明这些代码任务使用 DeepSeek Harness 的 minimal mode,并把 reasoning effort——模型回答前投入多少推理——设为 max。不同模型的运行框架和设置是否完全可比,材料没有进一步说明。
横向看,新模型并非每项都领先。Terminal Bench 2.1 的 87.9 接近 Kimi K3 的 88.3和 Fable-5 的 88.0;NL2Repo 的 61.5低于 Opus-4.8 的 69.7;DeepSWE 的 62.7高于 Opus-4.8 的 58.0,但低于 Kimi K3 的 67.5。更稳妥的结论是:按官方公布的这组测试,它已经进入强势旗舰模型的竞争区间,而不是全面压过所有对手。
开放权重,让选择不只剩 API
这次值得关注的不只是分数,还有分发方式。模型权重——训练完成后保存下来的大量数值参数——已经出现在 DeepSeek 官方 Hugging Face 仓库。开发者可以下载并自行部署,不必只能通过 API 使用。API 是软件通过网络调用托管模型的接口,省去自备硬件的麻烦;自行部署则能让运行位置和工具链更可控。
但“开放权重”不自动等于严格意义上的开源,还要看许可证允许怎样使用、修改和再分发。现有供稿在架构介绍处截断,也没有完整许可证信息,因此这里不能进一步判断其开放程度。
第三方 Unsloth 已发布 DeepSeek-V4-Pro-0813 的 GGUF 版本,并列出 llama.cpp、Ollama、LM Studio 等本地工具的使用入口。GGUF 是本地推理工具常用的模型文件格式,经常与量化版本一起提供。量化会用较低精度保存和计算权重,减少内存、显存和算力需求,像是把一本厚重工具书压成更便携的版本;代价是压缩越激进,越需要检查能力损失。现有材料能确认这些制品和运行入口存在,却没有给出硬件门槛、实际速度、内存占用或量化后的测试成绩。
为什么现在值得看?
V4 Pro 正式版把三条路线放到了同一天的观察窗口里:想省事的团队可以看云端 API;想自行部署的人有官方权重;想尝试本地运行的人已有第三方 GGUF。它因此不只是一轮模型分数更新,也关系到使用者要把算力放在哪里、愿意交出多少控制权,以及为便利支付多少成本。
定价恰恰是目前最模糊的一环。供稿只提供了一则题为“Deepseek new pricing”的 Reddit 帖和官方定价页链接,没有页面正文、新旧价格或调整时间。现阶段甚至不足以确认价格确已变更,更不能判断涨跌幅。所谓“新定价同时出现”,仍需等待可核对的价格表或官方说明。
局限与未知
- 发布日期尚不能精确落定:“today”只有官方 X 的二手转述,缺少原帖时间与时区。
- 性能数据来自 DeepSeek 官方,部分 DSBench 项目还是内部测试集,尚无独立复核。
- 参数规模、上下文长度、许可证、本地硬件成本及 API 新旧价格,都不能从现有材料可靠确认。