和 AI 聊上几句,觉得它“像人”,不等于它会可靠推理,更不等于它能在现实中稳定做事。图灵测试——让评审仅凭文字交流判断对方是人还是机器——测到的主要是对话中的以假乱真。今天再用一次对话概括机器智能,显然容易把许多不同能力揉成一个模糊印象。
Hernandez-Orallo、Collins 等研究者在 Science 发文,重新追问 AI 能力应当如何定义和测量。关键提醒是:智能不是一根单一刻度。AI 评测基准就像统一试卷,分数只能说明模型在特定题目和规则下的表现;还要追问“构念效度”,也就是这张试卷究竟测到了推理、记忆、猜测,还是几者的混合。进一步说,评测既要区分 AI 在特定条件下“能不能做”,也要观察它实际怎样做、是否稳定、何时失败。
供稿仅提供论文书目信息,未披露作者提出了哪些具体新测试或验证结果,因此这里不作延伸。值得记住的不是再造一场更难的图灵测试,而是先说清我们想测哪一种能力,再决定怎样出题。