看见 AI 主动裁剪、放大图片,很容易觉得它在认真找证据。但动作像推理,不等于动作有用:有时模型只是摆弄了一圈图片,最后仍按原先的猜测作答,还付出了更多 token 成本。
Wang 等人把这种视觉工具调用画成因果图——用箭头区分“新画面影响答案”和“仅仅调用工具就改变答案”两条路径,再替换或破坏工具返回的画面,看答案是否跟着变化。审计覆盖六个模型和五项细粒度视觉基准。一个直观结果是,Qwen3-VL-4B 在 HR-Bench-8K 上启用工具后准确率为 75.3%,低于直接回答的 76.9%;DeepEyes 在 V* 上则同为 83.3%。
作者发现两类典型失灵:模型可能“调用却不看”,返回画面并未因果性地影响答案;也可能“看了却没规划”,在答案已经正确后继续操作,或反复裁剪无关区域。作者据此提醒,整体分数上涨主要集中在少数工具使用得当的样本中,不能证明多数可见操作都构成了有效推理。