将 Z 分数转换为随机概率
P 值是指如果实际上不存在真实效应,纯粹由随机因素得到至少与观察到的结果同样极端的结果的概率。 输入一个 Z 分数并选择检验类型,此计算器将其转换为 P 值 — 这是用来判断结果是否具有统计显著性的标准数字。如果您有原始样本数据而非已计算好的 Z 分数,请先使用 Z分数计算器 求出该值。
较小的 P 值意味着观察到的结果仅凭随机因素发生的可能性较低,这是反对“没有真实效应存在”这一假设(“原假设”)的更有力证据。按照大多数领域的长期惯例,P 值低于 0.05 通常被视为具有统计显著性 — 但该阈值只是一种惯例,而非自然法则,“足够显著”的标准可能因领域而异,也取决于错误结论的代价有多高。
计算公式
对于左尾检验(结果是否异常偏低?):
对于右尾检验(结果是否异常偏高?):
对于双尾检验(结果是否在任一方向上异常?):
其中 是 Z 分数, 是标准正态分布的累积分布函数 — 即从该分布中随机抽取的值落在给定点或以下的概率,此处通过误差函数的一种成熟多项式近似方法计算得出。
举例说明
- Z 分数为 1.96 是双尾检验在常规 95% 置信水平下的教科书参考点:。 2. 约 0.05 的 P 值恰好处于常规显著性阈值。 3. 更大的 Z 分数 2.576(99% 置信度的双尾参考点)给出更小、更显著的 P 值,约为 0.0100。
需要考虑的关键因素
- P 值并不能告诉您原假设为真的概率。 这是统计学中最常见的误解之一——0.03 的 P 值意味着如果原假设确实为真,观察到这个结果(或更极端结果)的概率为 3%,而不是原假设本身有 3% 的概率是正确的。
- 同一个 Z 分数在单尾和双尾检验下会给出不同的 P 值,选错检验类型可能产生误导。 单尾检验只检查某一特定方向上的效应,而双尾检验检查任一方向上的效应——应该在查看数据之前,根据实际的研究问题来决定选用哪一种,而不是事后为了得到看起来更有利的 P 值再去选择。
- 统计显著性和实际意义是两件不同的事。 在样本量足够大的情况下,即使是一个微小、在实际中毫无意义的效应也能产生非常小的 P 值——具有统计显著性的结果并不自动意味着现实世界中存在重要或巨大的效应,应将效应大小与 P 值一并考虑。
- 常规的 0.05 阈值是一种被广泛使用的惯例,而不是普适的科学定律。 一些领域(如粒子物理学)在宣布一项发现之前要求远比这更严格的阈值,而其他领域则将 0.05 视为合理标准——“足够显著”的标准取决于具体领域以及出错的代价。
常见错误
- 看完结果之后才决定检验类型。 单尾检验与双尾检验之间的选择应基于实际的研究问题,在拿到数据之前就确定——事后改用能得出更小 P 值的检验方式,即使并非有意为之,也是一种数据操纵。
- 报告 P 值时不附带任何效应量的度量。 P 值只能说明在原假设下某个结果有多不可能出现——它并不能说明这个结果实际上有多大或多有意义,这正是为什么 P 值通常要与置信区间或效应量一起报告,而不是单独报告。
- 把 p = 0.049 和 p = 0.051 当作根本不同的结果对待。 0.05 这条界限是一种惯例,而不是自然界中的一条分明界线——两个如此接近的结果在证据强度上实际上几乎相同,即使一个在技术上跨过了阈值而另一个没有。
- 进行大量检验,却只报告显著的那些。 测试足够多的比较,最终总会仅凭随机因素得出一个”显著”的结果——P 值的意义建立在事先计划好的单一检验之上,而不是从众多结果中挑选出来的最佳结果。