Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.029 — 2026-08-02
NEWS 约 1 分钟

医学VLM高分可能只是会套模板

胸片报告拿高分,可能只是模板写得像,却悄悄漏掉关键医学词。

一份胸片报告写得四平八稳,反复说“未见异常”,自动评分还很高,但真正需要提醒医生的少见病变词却不见了。这就像考试答案格式很标准,关键得分点却没写。VLM(视觉语言模型,即同时理解图片和文字的模型)生成放射学报告时,可能正出现这种问题。

据作者在 Reddit 的介绍,他们在胸部 X 光报告生成中发现,现有自动指标会奖励重复模板、缺少临床术语甚至偏向“正常”的报告;一些少见但有意义的词会被抹去,结果看似流畅,却没有临床用途。论文因此提出一套框架,专门衡量关键术语被删掉多少,以及模型又引入了哪些带偏向的词。

这项工作的提醒很直接:医疗 AI 的榜单高分,不等于报告可靠。尤其当评分更看重常见措辞或文本相似度时,模型越会套安全模板,反而越可能掩盖真正重要的信息。供稿未披露具体实验数字,相关效果目前只能按作者自述理解。


供稿材料 SOURCES — 1

← 返回 2026-08-02 · 科技板块