置信区间的计算方法
置信区间是围绕样本自身均值构建的一系列数值,很可能包含真实的总体均值。 输入样本的均值、标准差和样本量,选择置信度,此计算器将求出实际总体均值可能落入的范围。
例如,“95% 置信区间”意味着如果您重复相同的抽样过程很多次,所产生的区间中约有 95% 会包含真实的总体均值。这并不意味着真实均值有 95% 的机会落在这一个特定区间内 — 这是人们常见但技术上不正确的表述方式。更宽的区间(更高的置信度)撒下更宽的网,更有可能包含真实均值;更窄的区间更精确,但确定性较低。
公式
其中 是样本的标准差, 是样本量, 是所选置信度对应的临界值(从标准正态分布中查得), 是样本均值。样本量越大,标准误差越小 — 从而整个区间也越窄 — 因为更多的数据能对真实均值给出更精确的估算。
举例说明
一个包含 25 项的样本,均值为 100,标准差为 15,置信度为 95%(临界值 z = 1.96):
- 标准误差:。
- 误差范围:。
- 置信区间:。
因此真实的总体均值很可能(95% 置信度)介于 94.12 和 105.88 之间。
需要考虑的关键因素
- 置信区间无法说明样本是如何采集的。 这里的数学计算假设样本是对总体真正随机、具有代表性的样本——有偏差或非随机的抽样方法,可能产生一个看起来精确、但实际中心值完全错误的置信区间,而这个公式无法检测或纠正这个问题。
- 该区间假设底层数据至少近似服从正态分布,或样本量足够大以适用中心极限定理。 对于来自严重偏斜分布的小样本,z分布和t分布的近似都会变得不那么可靠。
- 民调或调查中报告的置信区间和误差幅度,描述的是同一个基本概念。 新闻报道中提到“正负3个百分点的误差幅度”(通常在95%置信水平下),描述的正是本计算器计算的这个区间,只是表述方式不同。
- 更窄的区间并不总是更好,如果这是以牺牲置信度为代价换来的。 在较低置信水平(比如80%而不是95%)下,更紧的区间更精确,但真正包含真实值的可能性更低——精度和置信度之间的正确权衡,取决于这个估算的实际用途。
常见错误
- 将”95%置信度”理解为”真实均值落在此区间内的概率为95%”。 一旦样本实际被采集且区间已计算出来,真实的总体均值要么在其中,要么不在——已经没有概率可言了。95%描述的是该方法在多次重复抽样中的长期表现,而不是这一个具体结果。
- 在未检验假设的情况下,将这个基于z分布的公式应用于小样本。 z分布假设样本量较大(通常n约为30或以上)或总体标准差已知。仅有估计标准差的小样本,从技术上讲应改用t分布,它会得出一个略宽——也更诚实——的区间。
- 将置信区间与原始数据的范围混淆。 该区间描述的是关于总体均值的不确定性,而不是各个数据点的分布位置——一个数据集的取值范围可能远比其置信区间宽泛得多,而均值本身的区间仍可能很窄,尤其是在大样本情况下。
值得了解
由于标准误差是随样本量的平方根而非样本量本身缩小的,将误差范围减半通常意味着需要将样本量扩大约四倍,而不仅仅是两倍——在规划一项调查或实验实际需要多大规模时,这是一个值得注意的细节。这也解释了为什么只有几百名受访者的民调仍能报告相当窄的误差范围:一旦样本达到几百人,平方根关系意味着每增加一名受访者带来的精度提升会逐渐减少,因此民调机构很少认为有必要将样本量提高到数万人,只为将误差范围缩小一小部分百分点。