Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.054 — 2026-08-27
NEWS 约 1 分钟

llama.cpp开始动态选择推测策略

llama.cpp 分支开始自动调节草稿长度,让本地推理少靠手工试参数。

同一套加速参数,遇到不同内容未必都好用:规整文本容易猜,可以多猜几步;内容难预测时,猜得太远反而浪费计算。一个 llama.cpp 分支正在把这件事交给引擎处理。llama.cpp 是让大模型在个人电脑等本地硬件上运行的开源推理工具;新加入的“自适应推测”允许用户只设最小值和最大值,再由引擎自动调整每轮建议的 token 数量。token 是模型处理文字的基本片段。

这里利用的是推测解码:先用较便宜的方法起草后续内容,再让主模型批量核验。供稿提到的 MTP(一次预测多个后续 token)和 DFlash(并行生成草稿候选)都能加速推理,但不同内容需要不同设置。作者称,这个分支相较 llama.cpp 主线最高可将 token 生成速度提高 50%;在 Strix Halo 上运行 Qwen3.8、生成结构化内容时,速度从每秒 44 token 升至 65 token。值得留意的是,目前材料展示的是自动调节草稿 token 数量,并未说明引擎如何在 MTP、DFlash 等路线之间自动切换;效果数字也来自项目作者自述。


供稿材料 SOURCES — 1

← 返回 2026-08-27 · 开源板块