Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.023 — 2026-07-27
NEWS 约 1 分钟

4B开源模型逼近o3医学答题水平

约40亿参数的开放权重模型,在瑞典医学选择题中已接近o3得分

专业考试曾是大型闭源模型的优势场。如今,一个更容易自行部署的小模型也开始追上来。实验作者在瑞典执业医师考试选择题上测试发现,Qwen3.5-4B——约有40亿个参数、可下载训练后参数的开放权重模型——无需额外训练就达到77%准确率;开启“推理”后升至87%。作为参照,o3在2025年一个规模更小、题目部分重叠的数据集上得分88%,两者并非严格同场对比,但差距已很小。

更早的MedGemma-1.5-4B需要用往年试题做SFT——即拿标准答案继续训练——才达到60%的及格线。作者还发现,Qwen3.5-4B有时会在推理中反复纠结格式,直到耗尽可用长度;强制它提前结束思考反而有帮助。值得知道的是,这说明小型模型的专业答题能力进步很快,不代表它已有真实临床能力:选择题无法检验问诊、操作、沟通和面对不确定病例时的判断。


供稿材料 SOURCES — 1

← 返回 2026-07-27 · 科技板块