针对分布平均值对数值进行标准化
Z 分数衡量一个数值高于或低于分布平均值多少个标准差。 输入一个数值、该分布的平均值及其标准差,即可求出 Z 分数以及对应的百分位——即正态分布中有多大比例落在该数值或以下。
Z 分数为 0 表示该数值恰好等于平均值。正 Z 分数高于平均值;负 Z 分数低于平均值。由于正态分布中大约 68% 的数据落在平均值的 1 个标准差范围内,95% 落在 2 个标准差内,99.7% 落在 3 个标准差内,因此仅凭 Z 分数就能立即感知一个数值有多么不寻常。
计算公式
百分位来自标准正态分布的累积分布函数——即从该分布中随机抽取的值落在所输入 Z 分数或以下的概率,此处通过一个成熟的误差函数多项式近似计算得出。
举例说明
一个 IQ 分数为 115,其中 IQ 分数的平均值为 100,标准差为 15:
- Z 分数:,然后 。
- 百分位:恰好为 1 的 Z 分数对应第 84.13 百分位——该数值高于分布中约 84% 的数据。
需要考虑的关键因素
- 这项计算假设底层分布真正呈正态(钟形)分布,但并非每个真实数据集都是如此。 许多现实 世界的测量值(如身高或智商分数)都足够接近正态分布,使这种计算行之有效,但严重偏态或存在 多个峰值的分布,其百分位无法用本计算器所依赖的标准正态曲线准确描述。
- Z 分数能把来自不同分布的数值标准化到同一个可比较的量表上。 这正是 Z 分数之所以能用来 比较一个数值在两个平均值和标准差都不同的测量结果中相对位置的原因——例如比较一场考试的成绩 与另一场评分标准不同的考试成绩。
- 本计算器计算的是单侧百分位(分布中处于该数值或以下的比例),这与双侧(两端)概率是不同 的概念。 根据所问问题的不同——「有多少比例的人分数比我低」相对于「这个数值在任一方向上有 多不寻常」——应使用的相关数字可能不同,值得先弄清楚具体使用场景真正需要哪一种。
- Z 分数计算器和统计计算器回答的是相关但真正不同的问题。 统计计算器根据原始数字计算数据 集自身的平均值和标准差,而本计算器则是针对一个已知分布的平均值和标准差,为单个数值打 分——两者通常配合使用:先计算出分布的参数,再用这些参数为具体数值打分。
常见错误
- 把样本统计量当作真实的总体平均值/标准差来使用。 从小样本估算出的平均值和标准差本身就 带有不确定性——把它们当作精确的总体参数,可能会让百分位看起来比实际情况更精确。
- 未经检验就假设底层数据呈正态分布。 百分位换算只对真正呈钟形的数据有效——对于偏态或多峰 分布,计算出的 Z 分数本身仍然有效,但由此得出的百分位数字可能严重误导。
- 将单侧百分位与双侧(两端)概率混淆。「有多少比例的人分数比我低」和「这个数值在任一方向 上有多不寻常」是答案不同的两个不同问题——针对具体情况用错了会导致对结果的误读。