把一百万 token 的材料一次交给本地 AI,相当于让它先吞下一大摞文本,再回答问题。Token 是模型切分文字的基本单位;窗口够大,只说明“装得下”,不代表读得快。开发者 peonist-ai 的实测显示,Qwen3.8-Flash-Next 在配备 128 GB 内存的 Ryzen AI Max+ 395 上,处理约 100.5 万 token 后,仍能以 38.3 token/s 生成内容。
真正昂贵的是开口前的等待。Prefill——模型先读取并计算整段输入的阶段——速度为 937 token/s,冷启动一次约需 17.9 分钟;随后的 Decode,也就是逐个生成新 token,反而保持了可交互的速度。halogen 0.12.0 相比 0.11.10,把同一条件下的解码速度从 27.3 提高到 38.3 token/s。若输入已进入提示缓存,后续一轮约 0.55 秒便可生成首个 token。
这组数据说明,百万上下文在本地已经能跑,但“能跑”和“随时可用”仍是两回事。结果来自作者报告,且百万 token 档只进行了一次冷请求,尚不足以说明不同任务下都能稳定复现。