专业考试曾是大型闭源模型的优势场。如今,一个更容易自行部署的小模型也开始追上来。实验作者在瑞典执业医师考试选择题上测试发现,Qwen3.5-4B——约有40亿个参数、可下载训练后参数的开放权重模型——无需额外训练就达到77%准确率;开启“推理”后升至87%。作为参照,o3在2025年一个规模更小、题目部分重叠的数据集上得分88%,两者并非严格同场对比,但差距已很小。
更早的MedGemma-1.5-4B需要用往年试题做SFT——即拿标准答案继续训练——才达到60%的及格线。作者还发现,Qwen3.5-4B有时会在推理中反复纠结格式,直到耗尽可用长度;强制它提前结束思考反而有帮助。值得知道的是,这说明小型模型的专业答题能力进步很快,不代表它已有真实临床能力:选择题无法检验问诊、操作、沟通和面对不确定病例时的判断。