置信区间

对比计算

下载

包含本次计算的输入与结果,以及您对比过的所有附加计算。

重要提示

本计算器使用Z分布,该分布假设样本量较大或总体标准差已知。对于样本量较小(约小于30)且标准差为估算值的情况,从技术上讲T分布更为准确,得出的区间会比本计算器显示的略宽。

置信区间的计算方法

置信区间是围绕样本自身均值构建的一系列数值,很可能包含真实的总体均值。 输入样本的均值、标准差和样本量,选择置信度,此计算器将求出实际总体均值可能落入的范围。

例如,“95% 置信区间”意味着如果您重复相同的抽样过程很多次,所产生的区间中约有 95% 会包含真实的总体均值。这并不意味着真实均值有 95% 的机会落在这一个特定区间内 — 这是人们常见但技术上不正确的表述方式。更宽的区间(更高的置信度)撒下更宽的网,更有可能包含真实均值;更窄的区间更精确,但确定性较低。

公式

标准误差=sn\vE{\text{标准误差}} = \frac{\vA{s}}{\sqrt{\vB{n}}} 误差范围=z×标准误差\vF{\text{误差范围}} = \vC{z} \times \vE{\text{标准误差}} 置信区间=xˉ±误差范围\text{置信区间} = \vD{\bar{x}} \pm \vF{\text{误差范围}}

其中 s\vA{s} 是样本的标准差,n\vB{n} 是样本量,z\vC{z} 是所选置信度对应的临界值(从标准正态分布中查得),xˉ\vD{\bar{x}} 是样本均值。样本量越大,标准误差越小 — 从而整个区间也越窄 — 因为更多的数据能对真实均值给出更精确的估算。

举例说明

一个包含 25 项的样本,均值为 100,标准差为 15,置信度为 95%(临界值 z = 1.96):

    1. 标准误差:标准误差=15÷25=3\vE{\text{标准误差}} = \vA{15} \div \sqrt{\vB{25}} = \vE{3}
    2. 误差范围:误差范围=1.96×3=5.88\vF{\text{误差范围}} = \vC{1.96} \times \vE{3} = \vF{5.88}
    3. 置信区间:置信区间=100±5.88=[94.12,105.88]\text{置信区间} = \vD{100} \pm \vF{5.88} = [94.12, 105.88]

因此真实的总体均值很可能(95% 置信度)介于 94.12105.88 之间。

需要考虑的关键因素

  • 置信区间无法说明样本是如何采集的。 这里的数学计算假设样本是对总体真正随机、具有代表性的样本——有偏差或非随机的抽样方法,可能产生一个看起来精确、但实际中心值完全错误的置信区间,而这个公式无法检测或纠正这个问题。
  • 该区间假设底层数据至少近似服从正态分布,或样本量足够大以适用中心极限定理。 对于来自严重偏斜分布的小样本,z分布和t分布的近似都会变得不那么可靠。
  • 民调或调查中报告的置信区间和误差幅度,描述的是同一个基本概念。 新闻报道中提到“正负3个百分点的误差幅度”(通常在95%置信水平下),描述的正是本计算器计算的这个区间,只是表述方式不同。
  • 更窄的区间并不总是更好,如果这是以牺牲置信度为代价换来的。 在较低置信水平(比如80%而不是95%)下,更紧的区间更精确,但真正包含真实值的可能性更低——精度和置信度之间的正确权衡,取决于这个估算的实际用途。

常见错误

  • 将”95%置信度”理解为”真实均值落在此区间内的概率为95%”。 一旦样本实际被采集且区间已计算出来,真实的总体均值要么在其中,要么不在——已经没有概率可言了。95%描述的是该方法在多次重复抽样中的长期表现,而不是这一个具体结果。
  • 在未检验假设的情况下,将这个基于z分布的公式应用于小样本。 z分布假设样本量较大(通常n约为30或以上)或总体标准差已知。仅有估计标准差的小样本,从技术上讲应改用t分布,它会得出一个略宽——也更诚实——的区间。
  • 将置信区间与原始数据的范围混淆。 该区间描述的是关于总体均值的不确定性,而不是各个数据点的分布位置——一个数据集的取值范围可能远比其置信区间宽泛得多,而均值本身的区间仍可能很窄,尤其是在大样本情况下。

值得了解

由于标准误差是随样本量的平方根而非样本量本身缩小的,将误差范围减半通常意味着需要将样本量扩大约四倍,而不仅仅是两倍——在规划一项调查或实验实际需要多大规模时,这是一个值得注意的细节。这也解释了为什么只有几百名受访者的民调仍能报告相当窄的误差范围:一旦样本达到几百人,平方根关系意味着每增加一名受访者带来的精度提升会逐渐减少,因此民调机构很少认为有必要将样本量提高到数万人,只为将误差范围缩小一小部分百分点。

来源: 使用 z 分布的标准统计推断公式.

常见问题

“95% 置信度”实际上是什么意思?

这意味着如果您重复相同的抽样过程很多次,所得区间中约有 95% 会包含真实的总体均值。这**并不**意味着真实均值有 95% 的机会落在这一个特定区间内 -- 这是人们常见但技术上不正确的表述方式。

为什么更大的样本量会缩小区间?

标准误差(以及误差范围)除以样本量的平方根,因此更多的数据会产生对真实总体均值更精确 -- 也更窄 -- 的估算。

我应该使用 z 分布还是 t 分布?

z 分布(此处使用)适用于大样本(n 约为 30 或更多)或已知总体真实标准差的情况。对于只有估计标准差的小样本,t 分布在技术上更准确,会产生略宽的区间。

如果我选择更高的置信度会怎样?

更高的置信度(例如 99% 而不是 95%)使用更大的临界 z 值,从而拓宽区间。这是一个不可避免的权衡:撒更宽的网使真实均值更有可能实际落在区间内,但代价是估算精度降低。

我的样本需要多大才能将误差范围减半?

大约需要扩大四倍,而不是两倍。标准误差随样本量的平方根缩小,因此将误差范围减半需要将观测数量增加到原来的四倍——在规划一项调查或实验实际需要多大规模时,这是一条有用的经验法则。

置信区间能说明样本是如何采集的吗?

不能——这个计算假设样本是真正随机且能代表总体的。有偏差或非随机的抽样方法仍然可能产生一个看起来精确、但实际中心值完全错误的置信区间,而这个公式没有任何办法检测或纠正这个问题。

置信区间和误差范围是同一回事吗?

它们从两个角度描述同一个基本概念:误差范围是样本均值的正负距离,而置信区间是该距离在其周围形成的完整范围。新闻报道中提到"正负3个百分点的误差范围"(在某个声明的置信水平下),描述的正是本计算器计算的这个区间。

确认您的年龄

为了创建账户,请告诉我们您的出生月份和年份。