用简单的话解释置信区间与样本量

三个按特定顺序衔接的统计概念——应该调查多少人、拿到数据后所得不确定性有多宽,以及如何判断一个差异是真实的还是只是噪音。

置信区间、样本量和p值是统计学中最常被误解的三个概念,而大部分困惑都源于没有看清它们是如何按顺 序衔接在一起的。 它们各自回答着真正不同的问题,并且按照特定顺序展开:应该收集多少数据、实际收 集到的数据有多不确定,以及那份数据中的差异究竟意不意味着什么。

收集数据之前:你需要多少数据?

样本量计算器

回答的是最先出现的问题,在收集到哪怕一份回答之前:在给定期望的误差 范围和置信水平的情况下,一项调查实际需要多少受访者或观测值?由于误差范围在基础公式中是被平方的, 把期望的误差范围减半并不只是把所需样本量翻一番——而是大约变为原来的四倍,这正是为什么一个较窄的 ±1%误差范围所需的受访者数量,会比典型的±5%多得多的原因。

实用建议: 在设计调查之前,先确定你的结果究竟需要多精确,而不是在之后才确定——在数据收集已经 开始之后再收窄误差范围,意味着样本量的决定其实已经(无论好坏)被定下来了。

拿到数据之后:你的不确定性有多宽?

置信区间计算器

回答的是相反的问题,即在真实数据存在之后:在给定样本的均值、 标准差和样本量的情况下,很可能包含真实总体值的区间有多宽?一个”95%置信区间”意味着,如果同样的抽 样过程重复很多次,所产生的区间中大约有95%会包含真实的总体均值——它”并不”意味着真实均值落在这一个 具体区间内的概率是95%,这是一个即便是经常使用这个术语的人也会混淆的区别。样本量的同一种平方根关 系在这里同样出现:更大的样本会缩小标准误差(从而缩小整个区间),但要把区间再缩小一半,又需要大约 把样本量再翻两番,而不仅仅是翻倍。

实用建议: 新闻报道中”误差范围正负3个百分点”描述的正是这同一个区间,只是换了一种说法——而更 窄的区间并不会因为是以更低的置信水平为代价而自动变得更好,因为精确度与置信度是相互权衡的。

判断一个差异是否真实

P值计算器

回答的是第三个、真正不同的问题:在比较或检验得出一个z分数的情况下,如 果实际上根本不存在真实效应,纯粹由于偶然观察到如此极端结果的概率是多少?低于常规0.05阈值的p值 通常被视为具有统计学显著性——但这个阈值只是一个被广泛使用的惯例,而非自然法则,而且p值从来不会 告诉你原假设本身为真的概率,这是一种常见且后果重大的误解。

实用建议: 统计显著性和实际意义是两回事——只要样本足够大,即便是一个微小、在实际中毫无意义 的效应也能产生非常小的p值,因此p值最好和置信区间或效应量一起解读,而不要单独看待。

综合运用

自然的顺序是:在规划一项调查或实验时使用 样本量计算器 来决定为达到所需精度应 收集多少数据,在拥有真实数据后运行 置信区间计算器 来看看你实际的不确定性 究竟有多宽,并在比较组别或检验某个具体假设时使用 P值计算器 来判断观察到的差异是 很可能真实还是只是噪音。这三个工具位于同一统计流程的不同阶段——把哪个阶段该用哪个工具搞混(在还 没有数据时问置信区间的问题,或在已经有数据之后问样本量的问题)是人们误用彼此数字的最常见方式 之一。

本指南中使用的计算器

确认您的年龄

为了创建账户,请告诉我们您的出生月份和年份。