Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.094 — 2026-10-06
PAPER HF 23 约 1 分钟

物理智能榜单加入闭环体检

PhysVista把“看见—推断—核验”连起来,检查VLM是否真懂物理。

一段视频里,球滚下斜坡又突然向上加速。AI能认出“球”和“斜坡”,不等于它知道哪里不对。PhysVista要测的正是这道差距:VLM(视觉语言模型——能同时看画面、读文字并作答的模型)究竟理解了物体如何运动,还是只会识别画面、套用熟悉说法。

它把评测做成“看见—推断—核验”的闭环:先识别物体状态,再判断时间顺序和因果关系,最后给整段动态的物理合理性打分、排序。一个值得注意的设计是,它不仅问“事情有没有发生”,还测尺度层面的差别,例如幅度、数量、位置或比例是否准确;数据同时覆盖真实视频与AI生成视频,后者看起来逼真,却可能出现穿透、重力异常或因果次序错乱。

作者称,多种VLM的实验暴露出物理推理和合理性判断上的明显不足,说明“看懂画面”与“理解物理”之间仍有缺口。不过,现有供稿未给出具体模型得分,因此暂时更适合把PhysVista看作一套更完整的体检框架,而非能力排名的定论。


供稿材料 SOURCES — 1

← 返回 2026-10-06 · 学术板块