求出调查所需的最小样本量
样本量确定用于计算一项调查需要多少受访者或观测值,才能在选定的置信水平下,将总体比例的估计误差控制在选定的误差范围之内。 选择一个置信水平、一个期望的误差范围,以及(如果有的话)一个预估比例,此计算器将在您收集任何一份回复之前,计算出所需的最小样本量。
这是先于置信区间计算器自身问题而出现的问题 — 那个计算器会告诉您,您已有的数据产生了多宽的区间;而这个计算器则告诉您,一开始应该收集多少数据,才能使所得区间不会宽于您愿意接受的范围。
如果您知道总体规模(您可能调查的人员或项目总数),输入它将应用有限总体校正,这在总体本身较小时能显著缩减所需的样本量。留空则假设为庞大或未知总体,这是更安全、更常见的情况。
计算公式
其中 是所选置信水平对应的临界值, 是预估比例(以小数表示), 是期望的误差范围(以小数表示)。结果向上取整,因为样本不能包含零点几个受访者。
当已知总体规模 时,将应用有限总体校正:
当真实比例未知时,(50%)是最保守的选择 — 恰好在 50% 时达到最大值,这使得所需样本量达到最大(因此永远不会被低估)。
举例说明
在 95% 置信水平(z = 1.96)、期望误差范围为 ±5%、预估比例为 50%(保守默认值)的情况下:
- 将 z 平方并乘以 p(1-p):。
- 除以 e 的平方:。 3. 向上取整,因为样本不能包含零点几个受访者:。
对于一个庞大或未知的总体,您需要 385 名受访者。如果真实总体只有 1,000 人,有限总体校正会将其缩减为:
- 用 n0 减去 1 并除以总体规模:。
- 加上 1:。
- 用 n0 除以该结果:。
一旦确定总体本身规模如此之小,仅需 278 名受访者即可。
需要考虑的关键因素
- 期望的误差范围越小,所需的样本量增长得不成比例地更大,而不是成比例地增大。 由于误差范 围在公式分母中是平方项,把误差范围减半,所需样本量大约会变为原来的四倍 — 这正是为什么非 常严格的误差范围(如 ±1%)所需的受访者人数,会比更常见的 ±5% 多得多。
- 更高的置信水平也会增加所需的样本量,但增幅不如收窄误差范围那么剧烈。 从 90% 提高到 95% 再到 99% 的置信水平,会增大公式中所用的临界 z 值,从而提高所需的样本量 — 置信水平与 样本量之间的具体权衡,是一项真实的规划决策,而不是一条固定的规则。
- 这个公式估算的是针对单一比例(例如「有百分之多少的人偏好 X」)的样本量,并非适用于所有 类型的统计问题。 估算一个数值型平均值(例如平均消费额),或检测两组之间的差异,都使用与 此相关但不同的样本量公式 — 本计算器专门针对比例估算这一最常见的调查场景。
- 有限总体校正只有在总体本身相对较小时,才能明显缩减所需的样本量。 对于一个庞大的总体 (数万人以上),该校正对所需样本量的影响可以忽略不计 — 这正是为什么调查方法学通常把「庞 大总体」和「未知总体」视为功能上等同的情况,二者都默认使用未经校正的公式。
常见错误
- 将总体规模输入为您计划联系的人数,而不是您实际抽样所依据的总体人数。 有限总体校正仅适用 于您可能调查的「总体」群体(例如某公司全部 1,000 名员工)— 输入您希望收集的回复数量会使该 计算失去意义。
- 假设较小的误差范围只需要略微增大样本量。 由于误差范围在公式中是平方项,将其减半会使所需 样本量大约变为原来的四倍 — 在没有考虑样本量成本的情况下规划严格的误差范围,是常见的意外。
- 将此计算器与置信区间计算器混淆。 此计算器回答「在收集数据之前我需要多少受访者」;另一个 计算器回答「我已收集的数据实际上有多精确」— 二者方向相反,不能互相替代。