P值

对比计算

下载

包含本次计算的输入与结果,以及您对比过的所有附加计算。

将 Z 分数转换为随机概率

P 值是指如果实际上不存在真实效应,纯粹由随机因素得到至少与观察到的结果同样极端的结果的概率。 输入一个 Z 分数并选择检验类型,此计算器将其转换为 P 值 — 这是用来判断结果是否具有统计显著性的标准数字。如果您有原始样本数据而非已计算好的 Z 分数,请先使用 Z分数计算器 求出该值。

较小的 P 值意味着观察到的结果仅凭随机因素发生的可能性较低,这是反对“没有真实效应存在”这一假设(“原假设”)的更有力证据。按照大多数领域的长期惯例,P 值低于 0.05 通常被视为具有统计显著性 — 但该阈值只是一种惯例,而非自然法则,“足够显著”的标准可能因领域而异,也取决于错误结论的代价有多高。

计算公式

对于左尾检验(结果是否异常偏低?):

p=Φ(z)p = \Phi(\vA{z})

对于右尾检验(结果是否异常偏高?):

p=1Φ(z)p = 1 - \Phi(\vA{z})

对于双尾检验(结果是否在任一方向上异常?):

p=2×(1Φ(z))p = 2 \times \left(1 - \Phi(|\vA{z}|)\right)

其中 z\vA{z} 是 Z 分数,Φ\Phi 是标准正态分布的累积分布函数 — 即从该分布中随机抽取的值落在给定点或以下的概率,此处通过误差函数的一种成熟多项式近似方法计算得出。

举例说明

    1. Z 分数为 1.96 是双尾检验在常规 95% 置信水平下的教科书参考点:p=2×(1Φ(1.96))2×(10.975)0.0500p = 2 \times (1 - \Phi(1.96)) \approx 2 \times (1 - 0.975) \approx 0.0500。 2. 约 0.05 的 P 值恰好处于常规显著性阈值。 3. 更大的 Z 分数 2.576(99% 置信度的双尾参考点)给出更小、更显著的 P 值,约为 0.0100

需要考虑的关键因素

  • P 值并不能告诉您原假设为真的概率。 这是统计学中最常见的误解之一——0.03 的 P 值意味着如果原假设确实为真,观察到这个结果(或更极端结果)的概率为 3%,而不是原假设本身有 3% 的概率是正确的。
  • 同一个 Z 分数在单尾和双尾检验下会给出不同的 P 值,选错检验类型可能产生误导。 单尾检验只检查某一特定方向上的效应,而双尾检验检查任一方向上的效应——应该在查看数据之前,根据实际的研究问题来决定选用哪一种,而不是事后为了得到看起来更有利的 P 值再去选择。
  • 统计显著性和实际意义是两件不同的事。 在样本量足够大的情况下,即使是一个微小、在实际中毫无意义的效应也能产生非常小的 P 值——具有统计显著性的结果并不自动意味着现实世界中存在重要或巨大的效应,应将效应大小与 P 值一并考虑。
  • 常规的 0.05 阈值是一种被广泛使用的惯例,而不是普适的科学定律。 一些领域(如粒子物理学)在宣布一项发现之前要求远比这更严格的阈值,而其他领域则将 0.05 视为合理标准——“足够显著”的标准取决于具体领域以及出错的代价。

常见错误

  • 看完结果之后才决定检验类型。 单尾检验与双尾检验之间的选择应基于实际的研究问题,在拿到数据之前就确定——事后改用能得出更小 P 值的检验方式,即使并非有意为之,也是一种数据操纵。
  • 报告 P 值时不附带任何效应量的度量。 P 值只能说明在原假设下某个结果有多不可能出现——它并不能说明这个结果实际上有多大或多有意义,这正是为什么 P 值通常要与置信区间或效应量一起报告,而不是单独报告。
  • 把 p = 0.049 和 p = 0.051 当作根本不同的结果对待。 0.05 这条界限是一种惯例,而不是自然界中的一条分明界线——两个如此接近的结果在证据强度上实际上几乎相同,即使一个在技术上跨过了阈值而另一个没有。
  • 进行大量检验,却只报告显著的那些。 测试足够多的比较,最终总会仅凭随机因素得出一个”显著”的结果——P 值的意义建立在事先计划好的单一检验之上,而不是从众多结果中挑选出来的最佳结果。

实用信息

  • 您是从原始样本数据开始,而不是已知的 Z 分数吗?Z分数计算器 可以将某个原始值相对于已知的均值和标准差转换为此计算器所需的 Z 分数。
  • 想要一个可能值的范围,而不是单一的显著性判定吗?置信区间计算器 将不确定性表示为一个区间,是 P 值常见的搭配,而非替代品。
  • 需要先从一组原始数字中得到汇总统计量——均值、标准差、方差吗?统计计算器 可以直接从您的数据中计算这些值。

来源: 标准正态分布与 Abramowitz & Stegun 误差函数近似.

常见问题

什么样的 P 值算作“统计显著”?

在许多领域中最常见的惯例是 P 值低于 0.05(即结果仅由随机因素造成的概率为 5%)。这是一种广泛使用的惯例,而非严格规则 -- 在错误结论代价特别高昂的领域,有些会采用更严格的阈值(如 0.01)。

我如何知道应该使用单尾检验还是双尾检验?

当您关心结果是否在任一方向上异常时(例如“这枚硬币是否不公平?”),请使用双尾检验。只有当您事先特别关心某一个方向时(例如“这个新流程是否更快?”),才使用单尾检验(左尾或右尾)-- 在查看数据后才决定使用哪种检验被认为是不良的统计实践。

这与 Z 分数计算器有什么区别?

Z 分数计算器将一个原始数值转换为相对于已知分布的 Z 分数和百分位数。此计算器则从一个已知的 Z 分数出发,回答一个仅凭百分位数无法回答的具体问题:出现如此极端的结果纯粹由随机因素造成的可能性有多大?

确认您的年龄

为了创建账户,请告诉我们您的出生月份和年份。