调用 AI,读懂问题和写出答案并不一定需要同样多的算力。DeepSeek 于 9 月 10 日发布 V4.1 Flash,定位为新架构系列中尺寸最小的模型,并下调定价。它还具备原生视觉理解能力——模型自身就能同时处理文字和图像,不必外挂识图模块。
据 DeepSeek 披露,V4.1 Flash 是总参数 5520 亿的 MoE(混合专家模型,每次只调用部分“专家”子网络)。它采用非对称架构:读取输入时激活 80 亿参数,生成输出时激活 160 亿参数。说白了,先用较轻的配置理解材料,再把更多算力留给作答。官方还称,其 KV cache——模型处理长内容时保存的“临时记忆”——所需 HBM 降至上一代的四分之一,SSD 存储降至八分之一;这些效果尚待独立验证。
模型现已接入 DeepSeek API,旧 V4-Flash 与视觉实验版退役,旧名称暂时自动转向新版。定价继续分峰谷,闲时为高峰的一半。V4.1 Pro 上线前,相关请求也会转到 Flash 并按 Flash 价格收费。重点不只是一款更便宜的模型,而是 DeepSeek 正把高频、成本敏感的调用更明确地导向 Flash 档位。