你拿到一份医学报告,上面写着“95% 置信区间”。最顺手的理解,可能是“真实值有 95% 的概率落在这个范围里”。但在频率学派里,这并不是它的严格含义。它说的是:如果不断重做实验,并每次按同一规则计算区间,长期来看会有既定比例的区间覆盖真实值。对只学过贝叶斯统计的学生来说,这种说法尤其陌生,因为贝叶斯方法会直接用数据更新对未知量的认识。
Andrew Gelman 最近讨论的,正是一个颇有意思的教学难题:能不能不把频率学派当作统计学的默认起点,而是让已经会做贝叶斯分析的工程学生,反过来理解置信区间、假设检验和最大似然估计?这不只是课程如何编排的问题。它也提供了一个机会,让我们绕开“两派谁更正确”的老争论,重新观察统计工具究竟怎样服务估计、预测和工程决策。本文信息全部来自 Gelman 的一篇博客,其中课程安排与教材使用是当事人陈述,尚无独立材料交叉印证。
一门课遇到的现实难题
据 Gelman 博客转述,Opher Donchin 计划把一门本科生物医学工程统计课程,从标准的频率学派大纲转为“贝叶斯优先”。课程主要采用 Osvaldo Martin 的《Bayesian Analysis with Python》前六章。学生将先学习怎样建立模型、解释后验样本、执行基本的贝叶斯工作流,以及比较模型。
贝叶斯统计会先把已有认识写成“先验分布”,再用新数据把它更新为“后验分布”。说白了,先验是看数据前的不确定认识,后验是看完数据后修订出的认识。这样的教学顺序,让学生先接触“我们现在对未知量知道多少”,再学习具体计算程序。
但院系提出了一个实际要求:学生仍须读懂生物医学文献,而这些文献广泛使用置信区间、最大似然估计、假设检验和多重比较等频率学派术语。
最大似然估计(MLE)是在给定模型下,寻找最能解释已观察数据的参数值。假设检验则先设定一个“没有差异”之类的基准说法,再问当前数据在这个假设下是否异常。它衡量数据与假设是否相容,并不直接回答“这个假设为真的概率是多少”。多重比较处理的是另一类风险:同一批数据上检验的问题越多,偶然撞见看似显著结果的机会也越多。
于是问题变成了:怎样向已经熟悉贝叶斯思路、却从未学过经典统计程序的学生解释这些东西?现有的“两派比较”材料,并不一定适合这条反向学习路径。
不从工具目录讲起
Gelman 建议,先不要沿着“最大似然估计—零假设显著性检验—置信区间”的传统目录推进。更合适的起点,是所有统计工作都绕不开的几个目标:估计参数、作出预测、比较和评估模型,以及概括并处理不确定性。
这个换序很关键。传统课程容易让学生先记住一套套操作,再追问它们解决什么问题。贝叶斯优先的讲法则先问:我们想知道什么?要作出什么判断?然后再看两套范式分别怎样表达证据和不确定性。
频率学派把概率定义在假想的重复实验中:同一过程做很多次,事件出现的长期比例就是概率;参数通常固定,只是我们不知道。贝叶斯方法则允许用概率分布表达对未知参数的不确定认识。两派面对的工程目标可以相同,分歧主要在于问题怎样表述、概率指向什么,以及结论能够如何解释。
Donchin 提出的 F 检验教学设想很能说明这种“重读”。F 检验是一种经典统计程序。他希望先展示一个贝叶斯模型,再推演为了得到 F 统计量和 F 检验,需要从这个模型计算哪些量。他提到,这可能涉及对方差比的后验分布进行概括。不过,这仍是教学构想;材料没有提供完整推导,也没有验证它能否成为成熟的课程方案。
为什么工程学生需要两种语言
工程决策很少只是“算出一个数”。人们还要判断这个估计有多不稳定、模型能否预测新情况、不同解释如何比较,以及结果是否足以支持行动。Gelman 的提议有意思之处,就在于把这些共同目标放回中心。
这也解释了为什么贝叶斯优先不等于删掉频率学派。Donchin 列出的拟授内容仍然很广,包括标准误、置信区间、p 值、第一类与第二类错误、检验功效、t 检验、回归、ANOVA、F 检验、AIC 与交叉验证等。学生进入真实的生物医学环境后,需要看懂这些术语,也可能被要求使用相应程序。
因此,这门课要培养的不是“选边”,而是一种翻译能力:看到经典统计结论时,知道它实际计算了什么、不能被解释成什么;回到贝叶斯工作流时,也能辨认两者是在回答同一个问题,还是悄悄换了问题。
现成教材还没有完全对上
Gelman 起初推荐《Bayesian Data Analysis》第四章,后来也提到《Regression and Other Stories》第四章及书中其他相关内容。但他同时承认,前者主要面向已经懂经典方法、希望从贝叶斯原则重新理解它们的统计工作者。这与“从未学过经典方法的本科生”并不是同一项教学任务。后一本书也没有覆盖 F 检验或多重比较调整,Donchin 表示仍不足以满足课程需要。
局限与未知
- “缺少专门教材”只是供稿者基于个人检索的判断,材料没有界定检索范围,不能据此断言这类资源不存在。
- 博客没有给出完整课程实施结果、学生反馈或学习效果,因此目前讨论的是课程设计方向,不是已经验证的教学成果。
- 如何把 F 检验等程序逐项放进贝叶斯框架,材料只提出了设想,没有提供可直接复用的系统推导。
真正值得关注的,或许不是贝叶斯方法能否“收编”频率学派,而是统计教育能否先讲清问题,再介绍工具。学生最终仍会遇到两种语言。更好的课程,应当让他们知道每句话究竟承诺了什么。