如何求出平均值、中位数、众数与离散程度
此计算器可求出任意数字列表的平均值、中位数、众数、极差、方差和标准差。 将您的数字粘贴或输入到下方的框中——用逗号、空格或换行分隔,任意组合均可——所有常见的描述性统计量将一次性计算出来。
平均值是算术平均数。中位数是数字排序后的中间值(对于数量为偶数的列表,则是两个中间值的平均数)。众数是出现次数最多的值(或多个值)——如果每个数字都恰好只出现一次,则没有众数。
标准差衡量数字相对于平均值的离散程度——较小的标准差意味着数字聚集得较紧密;较大的标准差意味着它们分布得较广。此计算器以两种方式报告:总体标准差(当您的数字就是您关心的整个群体时)和样本标准差(当您的数字是用于估计更大总体的样本时)——样本版本稍大一些,以纠正样本倾向于低估整个总体真实离散程度的问题。
计算公式
总体或样本,与所使用的方差相匹配。
总体版本和样本版本之间的唯一区别是除以个数本身还是个数减一(称为贝塞尔校正)——其他一切都相同。
举例说明
数字 2、4、4、4、5、5、7、9:
- 个数:。总和:。平均值:。
- 排序后:2、4、4、4、5、5、7、9——中位数是两个中间值(4 和 5)的平均值: 。
- 众数:4(出现三次,多于任何其他值)。
- 极差:。
- 总体标准差:2.0。样本标准差:≈2.14。
需要考虑的关键因素
- 当数据集存在异常值或存在偏态分布时,平均值和中位数可能会讲述截然不同的故事。 单个非常 大或非常小的数值会把平均值拉向自己,而中位数则始终锚定在排序数据的中间位置,不受极端值的 影响——这正是为什么例如家庭收入中位数通常会被单独报告(或与平均收入一起报告),因为少数极 高的收入会把平均值向上拉偏。
- 选择总体标准差还是样本标准差,完全取决于您的数字实际代表什么,而不是个人偏好。 如果输 入的数字就是您所关心的整个群体(例如某个具体班级的所有学生),使用总体标准差。如果它们是 用于估计更大群体的样本(例如对部分顾客的调查,用来代表所有顾客),使用样本标准差——选错会 系统性地低估或高估真实的离散程度。
- 数据集可以没有众数、只有一个众数,或有多个众数,这与始终只有单一值的平均值和中位数不 同。 如果列表中每个值都恰好只出现一次,那就完全没有众数——而如果两个或更多值并列出现次 数最多,数据集就可能真正呈现「双峰」或「多峰」分布,这本身往往是关于底层数据的一个有意义 的信号。
- 标准差在大致呈钟形(正态)分布的数据中最容易直观解读,此时大约 68% 的数值会落在平均值 一个标准差范围内。 对于严重偏态或形状差异很大的数据,标准差仍然是有效的离散程度度量,但 直观的「68-95-99.7 规则」百分比就不再那么整齐适用了。
常见错误
- 出于习惯总是使用总体标准差(或总是使用样本标准差)。 哪一个是正确的完全取决于输入的数字 是整个群体还是其中的一个样本——选错了会系统性地低估或高估真实的离散程度,无论其余计算做得多 么仔细。
- 当数据存在偏态时,把平均值当作「典型值」。 少数异常大或异常小的数字会把平均值拉离大多数 数据真正所在的位置——对于收入或房价这类偏态数据,中位数往往才是更诚实的「典型值」。
- 忘记众数可以不存在、只有一个,或有多个。 假设每个数据集恰好只有一个众数,会在列表中没有 重复值(没有众数)或多个值并列出现次数最多(多峰)时造成困惑——这两种情况都是正常的、预期 之内的结果,而不是错误。