你让 AI 一次读完一大摞图文资料,它不仅要算得动,还要记得住。读得越长,模型保存的中间结果越多,显存和成本也随之上涨。DeepSeek-V4.1-Flash 想解决的正是这件事:让一个能看图、能读百万 token 长文本的大模型,少占一些“工作记忆”,也少做一些无效计算。
变化已经不只是社区传闻。DeepSeek 官方 Hugging Face 账号出现了 DeepSeek-V4.1-Flash 模型页面。我们在 9 月 10 日的 A5938 中还只能追踪内测信号,并提醒当时没有官方材料;现在至少可以确认,模型已经进入官方模型目录。不过,“页面现身”不等于完整发布:现有材料没有交代发布日期、许可证、权重文件状态或公开基准成绩。
552B,但不是每次都全员上场
据官方模型页介绍,DeepSeek-V4.1-Flash 是一个原生多模态模型——它从架构和训练阶段就统一处理图像与文字,而不是事后外挂一个独立视觉模块。模型接收图文输入,再以自回归方式逐个生成文本,也就是根据已经生成的内容继续预测下一个 token。
它拥有 552B backbone parameters,即主干部分约 5520 亿参数,并采用 MoE(Mixture of Experts,混合专家)结构。可以把 MoE 理解成一个规模很大的顾问团:总人数很多,但每道题只请少数相关专家参与。官方页面称,每个 MoE 层包含 1 个共享专家和 384 个按需调用的专家,每个 token 只激活其中 6 个。这样既能容纳庞大的总参数,又不必在每一步把所有参数都算一遍。
模型由 40 层 Transformer 组成,前 20 层是因果编码器,后 20 层是解码器,官方称之为 Causal Encoder-Decoder(CED)。这套安排的重点不只是“先读再写”,而是改变模型保存中间状态的方式。
给百万 token 的“草稿纸”瘦身
模型处理长输入时,会保存一批供后续生成反复调用的中间结果,这就是 KV Cache。它像读长文时留下的草稿纸:有了它,不必每生成一个词就从头重读;但文章越长,草稿纸也越厚。
官方页面称,CED 不再让解码器每一层分别产生自己的全局 KV Cache,而是从编码器最终的隐藏状态投影得到。由此,模型在 prefill 阶段——先把整段输入读入并建立缓存——每个 token 激活 8B 参数;进入 decode,也就是逐步生成答案时,每个 token 激活 16B 参数。这个设计尤其瞄准输入很长、输出相对有限的 agent 工作流。
DeepSeek-V4.1-Flash 还使用 CSA2(Compressed Sparse Attention 2,压缩稀疏注意力)。它让不同注意力层共享部分缓存和索引,并复用已经挑出的重点位置。直观地说,模型不必让每一层都重新翻遍整本资料,而是沿用前面整理好的重点目录。再配合 FP4 格式的主 KV 缓存,官方给出的全局 KV Cache 占用是每 token 890 字节,约为 DeepSeek-V4-Flash 的四分之一、DeepSeek-V1 的 1/437。
另一项 SWA Bounded Replay 会在需要时只重放最近一段 token,重建缺失的局部缓存,避免把这部分缓存长期写入 SSD。官方称,它把持久 KV Cache 压缩到 DeepSeek-V4-Flash 的约八分之一。模型因此支持最长 100 万 token 上下文。训练材料则称,它从零开始使用包含 45T token 的多模态语料训练,先在 64K 序列长度上训练稀疏注意力,并在训练进行到 34T token 时把上下文扩展至 1M。
官方上榜和自己跑,是两条线
官方页面已经列出 Transformers、vLLM、SGLang 和 Docker Model Runner 的调用或部署入口。这说明围绕模型的常见软件接口已经摆上页面,但仅凭这些说明,还不能确认权重是否完整开放,也不能据此判断普通机器能否直接运行这个 552B 模型。
与此同时,社区展示了另一条更具动手意味的路线。Reddit 用户 ciprianveg 报告称,他在 10 至 12 张 RTX 3090 上运行了 DeepSeek-V4-Flash-Vision-Exp。需要特别强调:这是另一个 285B MoE 实验模型,不是 552B 的 DeepSeek-V4.1-Flash,两者数据不能混用。
按照这名用户的单次自测,量化后的权重约为 157 GB;10 张 RTX 3090、每卡限制 240 W 时,借助 DSpark 投机解码可达到 60+ tok/s,12 张卡时达到 120+ tok/s。tok/s 是每秒生成的 token 数,用来衡量文本输出速度;投机解码则由较快流程先猜若干 token,再交给主模型批量核验,以争取提速。该用户还声称,这套配置无需卸载即可支持 1M context,将部分数据转移到系统内存后可支持 4M,长上下文 prefill 约为 3500 tok/s。
这组结果的意义不在于证明 V4.1-Flash 已能在家用电脑轻松运行。十几张 RTX 3090 仍是一套显著超出普通个人电脑的集群。它更像一次边界测试:社区正在用量化、补丁、并行切分和功耗限制,把超大多模态模型推向相对容易获得的消费级硬件。
为什么现在值得看
正式发布与本地部署回答的是两个不同问题:前者问“模型能否获取和调用”,后者问“用户能否在自己的硬件上跑起来”。这一次,两条线几乎同时露出轮廓。官方模型页让 V4.1 Flash 从未确认信号变成了可核对的具体条目;第三方实验则提前展示了同系列 285B 模型在消费级显卡集群上的可能速度。
据 DeepSeek API Docs,DeepSeek 还宣布 V4.1 Flash 在性能、成本、速度和总耗时上胜过 V4 Pro,并计划逐步退役后者:从 9 月 14 日中午起,原本发往 deepseek-v4-pro 的请求将自动转给 Flash,并按更便宜的 Flash 价格计费。V4 Pro 在 8 月 13 日才完成正式版上线,不到一个月便被同门快版替代。这比任何“迭代加速”的口号都更直观。
局限与未知
- 官方页面摘录在评测部分中断,没有提供完整基准、对照模型和成绩,现阶段无法独立判断能力提升幅度。
- 页面没有说明许可证、权重文件状态和发布日期,因此“正式现身”应严格理解为官方 Hugging Face 页面已经出现,而不是据此推断全面开放权重或完成产品发布。
- 285B 实验模型的速度、显存占用和最长上下文全部来自一名 Reddit 用户,依赖特定量化、运行补丁、GPU 并行拓扑及功耗设置;“可复现”和“全部可用”也是发布者自己的表述,仍需独立复测。