医疗AI像学生参加模拟考:分数涨得很快,但如果题目、考官和标准答案都不够可靠,高分未必代表真能看病。Nature 7月28日的 News & Views 讨论了两款助手:MIRA 在沙盒化电子病历中处理500多个回顾性病例,可从超过85,000项临床操作中选择问诊、检查和治疗;AMIE 则在盲法虚拟 OSCE——由标准化考站组成的临床能力考试——中,与21名初级保健医生比较,完成100个三次就诊场景。
真正值得注意的不是谁赢了,而是“尺子”是否量对了东西。MIRA 面对的是模拟患者,并非真实的前瞻性诊疗;AMIE 的表现由专科医生和患者扮演者评分,药物题集 RxQA 衡量的也是依据药品资料作答,而非完整处方流程。两项论文都把结果定位为迈向医疗应用的研究进展,同时明确提出仍需在真实世界中前瞻性验证安全性、泛化能力和治理。换句话说,医疗AI正在快跑,评测效度——测试是否真的测到临床能力——却还没有跟上。