Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.026 — 2026-07-30
NEWS 3 信源 约 1 分钟

DeepSeek V4 Flash跑上Strix Halo

128GB统一内存装下V4 Flash与草稿模型,作者称生成约32 tok/s

IMAGE — r/LocalLLaMA 日榜

想在个人工作站跑大模型,常见难题不是机器完全算不动,而是模型连同加速组件根本装不下。sandropuppo称,他们把DeepSeek V4 Flash压缩到102.3GB,再加上11.3GB的投机草稿模型,一起塞进配有128GB统一内存的Ryzen AI MAX+ 395,并把生成速度推到约32 tok/s。统一内存就是CPU与集成GPU共用一池内存;投机解码则像让小模型先起草,再由大模型批量核对,以减少计算轮次。

这次压缩并非把所有参数一刀切成2位,而是按权重敏感程度混用约2至4位精度,最终平均约2.88位。作者称该成绩比7月25日LocalMaxxing上同款集成GPU的次快记录高68.5%,但也强调这不是受控对照测试。与此同时,llama.cpp正在审查DSpark投机解码支持,目前PR先覆盖Qwen3,DeepSeek V4仍列为后续;旧版V4 GGUF的聊天模板也需改用新版文件,否则可能破坏“保留思考”行为。


供稿材料 SOURCES — 3

← 返回 2026-07-30 · 开源板块