AI 回话慢,不一定只是模型太大:它先要“读完”提示词,再逐个写出词元。前一段叫预填充(prefill),长提示词会拖慢它;后一段叫解码(decode),每个新词都依赖前文,难以直接并行。文章据此把体验拆成两个指标:首个词元等待时间(TTFT),以及后续每个词元的生成时间(TPOT)。
作者给出的七类工程手段可当作上线前检查表。最具体的一项是量化——用更少比特保存模型权重。文中估算,700 亿参数模型用 FP16 格式仅加载权重就约需 140GB 显存;改成 4 位表示,可大幅减少数据搬运,但可能牺牲推理质量。另两项分别是 KV Cache——把已经读过的上下文中间结果留在显存里,避免反复计算;以及投机解码——让小模型先猜一串词元,再由大模型批量核验。前者拿显存换速度,后者绕开逐词等待。说白了,优化不能只盯一个数字:还要权衡质量、显存、吞吐量与单个用户的等待时间。