你把一整个代码库、几百页资料和长期对话交给 AI,希望它综合回答,而不是读到后面就忘了前面。DeepSeek-V4 Preview 想解决的正是这个问题:让模型一次接收更多材料,同时尽量压低处理长文本的成本。值得注意的不只是“百万上下文”,而是开放权重、长上下文和高低配产品线在同一次发布中落地。
据 DeepSeek 官方信息,V4 Preview 于2026年4月24日发布并开放模型权重,包含 V4-Pro 与 V4-Flash。两者都支持100万 Token 上下文,网页、App 和 API 同日上线。Token 是模型切分文字的基本单位;百万 Token 意味着一次可以放入大量文档、代码或历史记录,但容量大不等于模型能准确找到并使用其中每一处信息。
Pro 与 Flash,差别不只是名字
DeepSeek 把 V4-Pro 定位为能力版本,把 V4-Flash 定位为更快、更经济的版本。官方规格称,Pro 有1.6万亿总参数,每处理一个 Token 激活490亿参数;Flash 有2840亿总参数,激活130亿参数。
这里的“激活参数”,可以理解为模型每次答题时真正叫来工作的那部分参数。总团队很大,不代表每道题都需要全员出动。因此,相比总参数,激活参数更能提示单次推理需要多少计算。不过,官方没有给出完整的硬件、精度、吞吐量和价格对照,不能仅凭参数规模算出真实部署成本。
品玩转述称,Pro 在 Agentic Coding——让 AI 自主规划并执行编程任务——评测中达到开源模型最佳水平,Flash 在简单任务上可接近 Pro。DeepSeek 还称 Pro 的知识与推理能力领先,模型针对 Claude Code、OpenClaw 等 Agent 产品做了适配。但这些结论均来自公司口径,目前缺少具体榜单、分数、测试方法和独立复测,适合视作产品定位,而非已经坐实的横向结论。
百万上下文怎么降成本?
DeepSeek 称,新架构结合按 Token 压缩与 DSA(DeepSeek Sparse Attention,DeepSeek 稀疏注意力)。普通注意力会广泛计算文本中各个位置之间的关系;文本越长,这项工作越重。稀疏注意力则只重点计算部分关系,像读长报告时先找相关章节,而不是让每句话都与全文逐一比对。它的目标是降低长上下文所需的计算量和显存——显存是芯片存放模型及其中间结果的工作空间。
API 同时提供 Thinking 与 Non-Thinking 模式,也就是偏重推理过程与偏重直接回答的两种使用方式,并兼容 OpenAI Chat Completions 和 Anthropic API 格式。这降低了既有应用迁移接口的门槛,但不代表迁移后效果与成本无需重新测试。
为什么现在值得回看?
这次预览版奠定了两条后来仍重要的产品线索:一是 Pro 与 Flash 分别承担能力和效率取向;二是百万上下文成为两个版本共同提供的能力,而非单独的高配功能。本刊9月11日报道的后续 V4.1 Flash,重点已转向缓存压缩、降价以及接替旧 Pro 接口。按时间看,V4 Preview 更像这套产品分层与长上下文路线的起点。
“开放权重”也需要说清:它指公开训练完成后的模型参数,允许开发者在自有硬件上部署或继续训练,并不自动意味着训练数据、训练代码和全部开发流程都已公开。
局限与未知
- 尚无材料说明百万 Token 是原生能力、扩展上限,还是在何种测试条件下达到;也没有公开长文定位和跨文档推理的有效性数据。
- 官方未提供许可证细节、完整开放范围,以及本地部署所需硬件与实际成本。
- “领先”“更快”“更经济”等说法缺少独立评测和统一对照;Pro 与后续 V4.1 Flash 的具体能力继承关系也未披露。