iikuuuDATA / METHOD / STUDY登录平台

ikuuu 统计学习与数

同一份数据试了很多模型,为什么最小的 p 值往往最不可靠

同一数据反复更换变量、分组和模型,再只报告最小 p 值,会扩大偶然显著和选择偏差。本文结合 ASA 六项原则与 NIST 多重比较方法,说明检验族、效应大小、区间和透明报告。

同一份数据交给统计软件,研究者先放入十个变量,又删掉两个分组,再换三种模型。最后屏幕上出现一个 p=0.018,于是报告只保留这组结果。数字看起来符合“低于 0.05”的习惯,却没有告诉读者,它是从多少次尝试中挑出来的。

p 值的计算以一个已经指定的模型和检验为前提。分析路径若在看过结果后不断改变,最小数字不再代表单次检验原有的错误率。它可能只是许多机会里偶然出现的一次低值。问题不在软件算错,而在报告隐藏了选择过程。

p 值回答的问题比想象中窄

美国统计协会的正式声明指出,p 值可以表示数据与一个指定统计模型有多不相容。这里包含两个限定:模型必须说清楚,数据也必须按该模型的条件理解。p 值不是脱离设计、样本和假设的通用证据分数。

声明同时否定两种常见解释。p 值不是“研究假设为真的概率”,也不是“数据完全由随机机会产生的概率”。计算通常假定零假设和模型条件成立,再衡量当前或更极端数据出现的程度。它没有反过来计算假设本身为真的概率。

因此,p=0.03 不能改写成“结论有 97% 概率正确”。它也不能说明结果有 97% 机会可以重复。重复性还受样本波动、研究设计、测量误差、模型选择和真实效应大小影响。把 0.03 变成成功率,会给数字加入计算中没有的信息。

ASA 还强调,科学、商业或政策结论不应只看是否跨过一个固定门槛。p=0.049 与 p=0.051 的差距很小,却常被写成“有”与“没有”效果。这样的二分法会忽略估计值、区间和实际重要性。

尝试次数增加会扩大偶然机会

假设每次检验在零假设成立时有 5% 机会误报显著。只做一次检验,错误机会是 0.05。若做二十次彼此独立的检验,并把任意一次低于 0.05 都当成发现,至少出现一次误报的机会约为 64%。

这个例子不是所有真实研究的精确公式。检验之间可能相关,模型也可能共享变量。它展示的是机制:机会次数越多,只挑最小值越容易遇到偶然低值。相关性会改变具体概率,却不会让未报告的选择自动消失。

“尝试”也不限于按下检验按钮。改变异常值规则、结局定义、时间窗口、协变量、分组边界或停止收样时点,都可能增加分析路径。若研究者看过结果后才决定保留哪条路径,读者就无法按单次检验理解最终数字。

最小 p 值特别吸引人,因为它容易被包装成清楚结论。然而,它通常也是选择偏差最大的候选。正确问题不是“这个值够不够小”,而是“总共考虑了哪些比较,哪些在看数据前确定,哪些在看数据后新增”。

同一份数据试了很多模型,为什么最小的 p 值往往最不可靠 配图 1
同一份数据试了很多模型,为什么最小的 p 值往往最不可靠 配图 1

ANOVA 显著不等于每一组都不同

NIST 的统计方法手册说明,多组均值的 ANOVA F 检验是一个总体检验。拒绝“所有组均值相等”的零假设,只能说明至少存在某种差异。它没有直接指出哪两组不同,也没有证明每一组彼此不同。

总体检验后,人们常把所有组两两比较。NIST 明确提醒,反复使用普通的成对程序通常不能保持原先设定的总体显著性水平。每一对都用 0.05,并不表示整组比较仍只有 5% 误报机会。

研究问题若在实验前已经明确,可以预先选定对比。NIST 提到,预定对比要受数量和独立性约束。这样的设计把比较写进研究问题,而不是看过柱状图后再寻找最漂亮的一对。

若比较必须在观察数据后决定,就需要多重比较程序。NIST 列出 Tukey 方法处理所有成对均值差,Scheffé 方法覆盖更广的线性对比。Bonferroni 方法可用于预选的一组对比和同时区间。三者控制的对象和保守程度不同,不能只按软件菜单任选。

“检验族”决定需要保护什么

多重比较修正前,要定义哪些检验属于同一个决策集合。若一项实验同时比较五种处理的主要结局,相关成对比较通常形成一个检验族。若另一个指标回答完全不同的问题,是否纳入同一族需要由研究目的说明。

同一份数据试了很多模型,为什么最小的 p 值往往最不可靠 配图 2
同一份数据试了很多模型,为什么最小的 p 值往往最不可靠 配图 2

把每个检验都拆成独立故事,会人为缩小错误范围。反过来,把整份研究里所有探索都塞进一个族,也可能失去解释性。边界应由共同结论和共同决策确定,而不是为了得到想要的门槛临时调整。

Bonferroni 的直观做法是把整体错误预算分给多个检验。例如十个预选检验若要控制总体 0.05,可把单项门槛设为 0.005。它不要求检验独立,计算也透明,但检验很多时可能较保守,真实的小效应更难被识别。

Tukey 方法针对所有均值两两比较,利用这类问题的结构。Scheffé 方法允许更广的事后对比,因此通常付出更宽区间或更高门槛。方法选择应跟计划比较的形状一致,而不是把修正理解为给 p 值统一乘一个数字。

效应大小和区间不能被门槛替代

ASA 的第五项原则指出,统计显著性不衡量效应大小,也不衡量结果的重要性。样本很大时,极小差异也可能得到很低的 p 值。样本很小时,实际重要的差异可能因为估计不精确而没有跨过门槛。

报告均值差、比例差或回归系数,能告诉读者变化方向与量级。置信区间则展示在指定方法下与数据相容的一段估计范围。区间很宽,表示数据仍允许多种实际解释;区间很窄但效应接近零,说明结果可能精确却不重要。

多重比较也影响区间。若研究者想同时陈述十个对比,单独的 95% 区间不能自动变成整组 95% 保证。NIST 将 Bonferroni 同时区间列为预选对比的一种工具。报告应写明区间是单项还是同时区间。

实际意义还需要领域尺度。体重变化 0.2 公斤、网页等待减少 20 毫秒或考试平均多 0.3 分,是否重要不能由 p 值决定。研究者应在看结果前说明值得关注的量级,并在结论里把统计不确定性和实际标准分开。

完整报告要保留没有“成功”的路径

ASA 把完整报告与透明度列为正确推断的必要条件。只公开显著模型,会让读者误以为分析从一开始就如此设计。未显著结果、替代规格和排除规则同样影响证据强度。

透明并不要求把每个临时文件都塞进正文。主文可以列出预设主要分析、探索性分析和敏感性分析。附表再说明变量组合、样本排除、转换方法和全部比较数。这样既保留阅读重点,也让他人知道最小值来自哪里。

同一份数据试了很多模型,为什么最小的 p 值往往最不可靠 配图 3
同一份数据试了很多模型,为什么最小的 p 值往往最不可靠 配图 3

预注册可以在收集或查看结果前固定主要问题、结局和分析方式。它不能保证设计正确,却能区分预先判断与事后探索。探索性分析并非低价值,只要明确标记,并在独立数据上再次检验。

代码、数据字典和版本记录也有作用。它们让复核者看见模型如何生成,而不是只收到最终表格。若数据受隐私或许可限制,仍可公开变量定义、分析代码和模拟数据结构,不必泄露个人资料。

一份可复核结果应包含七项内容

第一项是研究问题和主要结局。第二项是样本如何取得,以及哪些记录被排除。第三项是模型与假设,包括独立性、分布、线性或方差条件。第四项是总共执行的检验和比较族。

第五项是比较在看数据前还是之后决定。第六项是效应大小和相应区间。第七项是多重比较处理,包括方法、整体错误目标和未修正结果的标记。缺少这些内容时,单一 p 值无法承担完整结论。

读表时可以先寻找效应估计,再看区间宽度,最后查看 p 值如何产生。若报告只给星号,没有比较数量和模型说明,应把结论视为待补证据。不能因为星号多,就推断研究更可靠。

复核自己的分析时,应先列出全部尝试,再标注哪些属于主要分析。事后改变的选择要如实写明。修正方法由比较目标决定,必要时请统计专业人员复核。目的不是让所有结果失去显著性,而是让错误率与解释范围匹配。

最小数字不应成为唯一结论

同一数据上反复尝试模型,再挑出最小 p 值,会把探索过程伪装成一次预定检验。软件依照每个输入正确计算,也无法替研究者补上被隐藏的选择。错误来自结论的范围超过了分析记录。

ASA 的六项原则把 p 值放回指定模型、完整报告和效应解释中。NIST 的多重比较章节则说明,总体检验、预定对比和事后比较需要不同方法。两份资料共同指向一个简单边界:数字可以辅助推断,不能取代研究设计。

可靠报告不会只问 p 是否小于 0.05。它会说明比较族、尝试路径、修正方法、效应大小和区间。读者因此能够区分预先提出的判断与看过数据后的探索,也能判断结果在实际场景中是否重要。

资料依据:American Statistical Association。《Statement on Statistical Significance and P-Values》新闻声明,2016-03-07。3 页全文核读于 2026-07-29。National Institute of Standards and Technology。《NIST/SEMATECH e-Handbook of Statistical Methods》,2002-11-01;其中 7.4.7 多重比较章节全文核读于 2026-07-29。

资料来源

  • American Statistical Association:《Statement on Statistical Significance and P-Values》,发布或更新于 2016-03-07
  • National Institute of Standards and Technology:《NIST/SEMATECH e-Handbook of Statistical Methods: 7.4.7 Multiple Comparisons》,发布或更新于 2002-11-01