Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.028 — 2026-08-01
NEWS 约 1 分钟

llama.cpp能给推理设“思考预算”了

MindControl在采样器层提醒模型收住思考,测试中省下一半 token,编程表现基本不降。

IMAGE — r/LocalLLaMA 日榜

让本地模型解一道题,它有时会反复琢磨,答案没变好,等待和计算开销却一路增加。MindControl 的做法像在交卷前提醒一句“时间快到了”:它给模型设定思考预算——推理文本可使用的 token(模型生成文字的基本单位)上限,并在接近上限时提醒收尾,而不是到点直接截断。整个控制发生在 llama.cpp 的采样器层——也就是从候选 token 中选出下一步输出的环节,因此不用重新训练模型。

作者 hellajacked 此次补上了编程基准测试。在 Qwen3.6-27B 上,LiveCodeBench 各档预算都呈现同一排序:完整的“开场提示+软提醒+硬停止”最省 token;最高预算档的用量不到直接截断方案的一半,得分则基本相同。HumanEval+ 中,控制最强、预算最紧的设置反而拿到全场最高的 95.7%,token 约为无约束基线的一半。作者推测,预算可能减少了简单题上的过度思考或循环推理;不过这些结果目前来自作者自测,尚不能说明它对其他模型和任务同样有效。


供稿材料 SOURCES — 1

← 返回 2026-08-01 · 开源板块