让 AI 找东西时,人会自然地换个角度、放大细节,再决定下一步看哪里。ActiveVision 测的正是这种“主动视觉”:把感知和行动连成闭环,而不是只描述一张现成图片。这个新基准包含三类共 17 项任务,要求模型反复观察。
据论文讨论帖披露,GPT-5.5 即使采用最高档推理强度——回答前投入更多计算步骤——也只完成 10.6%,其中 11 项得分为零;三名人类参与者平均达到 96.1%,差距为 85.5 个百分点。Claude Fable 5 得分则为 3.5%。更值得注意的是,模型无法靠自己写代码补上缺口:会调用工具,不等于会规划下一步该观察什么。
这些分数只反映特定任务,不能直接等同于整体智能;但它清楚提醒我们,当前前沿模型在“看见”之外,距离像人一样主动地看,仍有很长一段路。