让本地模型解一道题,它有时会反复琢磨,答案没变好,等待和计算开销却一路增加。MindControl 的做法像在交卷前提醒一句“时间快到了”:它给模型设定思考预算——推理文本可使用的 token(模型生成文字的基本单位)上限,并在接近上限时提醒收尾,而不是到点直接截断。整个控制发生在 llama.cpp 的采样器层——也就是从候选 token 中选出下一步输出的环节,因此不用重新训练模型。
作者 hellajacked 此次补上了编程基准测试。在 Qwen3.6-27B 上,LiveCodeBench 各档预算都呈现同一排序:完整的“开场提示+软提醒+硬停止”最省 token;最高预算档的用量不到直接截断方案的一半,得分则基本相同。HumanEval+ 中,控制最强、预算最紧的设置反而拿到全场最高的 95.7%,token 约为无约束基线的一半。作者推测,预算可能减少了简单题上的过度思考或循环推理;不过这些结果目前来自作者自测,尚不能说明它对其他模型和任务同样有效。