Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.029 — 2026-08-02
PAPER H 10 约 1 分钟

推理正确,不等于证据用对

十个开放权重模型的对照实验显示:多想一会儿更会用现有证据,却未必更愿意主动求证。

一道题最后答对了,不代表推理过程真的可靠。就像面对两家收益未知的店,AI 可能只是根据现有评价选对了,却不愿尝试信息更少的那家。这篇论文追问的正是:推理时思考——回答前生成较长的中间推演——究竟让模型更会利用证据,还是更会寻找缺失信息。

作者让十个开放权重模型完成配对设计的“双臂老虎机”实验:模型反复在两个回报未知的选项间选择,并分别以思考和不思考模式作答。认知模型——用少量可解释参数拆解决策行为的数学模型——显示,思考平均会加强依据当前价值做选择的倾向,并减少与不确定性无关的随机失误;但两项探索指标都没有提供支持:模型既未更偏向信息较少的选项,也未随着总体不确定性上升而表现出更强的探索性变化。

换句话说,多想一会儿主要改善了“证据用得对不对”,没有让模型明显更愿意主动求证。作者也谨慎指出,思考长度和信心变化只与元认知控制、监测相符,尚不能证明这些过程真实存在。


供稿材料 SOURCES — 1

← 返回 2026-08-02 · 学术板块