信頼区間の計算方法
信頼区間とは、標本自身の平均を中心に構築された、真の母集団平均を含む可能性が高い値の範囲です。 標本の平均、標準偏差、サイズを入力し、信頼度を選ぶと、この計算機は実際の母集団平均がおそらく収まる範囲を求めます。
例えば「95%信頼区間」とは、同じサンプリングプロセスを何度も繰り返した場合、それが生成する区間の約95%が真の母集団平均を含むことを意味します。これは、真の平均がこの1つの特定の区間内に収まる確率が95%であることを意味するわけではありません — これはよくある技術的に誤った言い方です。より広い区間(より高い信頼度)はより広い網を張り、真の平均を含む可能性が高くなりますが、より狭い区間はより正確ですが確実性は低くなります。
計算式
ここでは標本の標準偏差、は標本サイズ、は選んだ信頼度の臨界値(標準正規分布から調べたもの)、は標本平均です。標本サイズが大きいほど標準誤差(したがって区間全体)が縮小します。データが多いほど真の平均のより正確な見積もりが得られるためです。
計算例
25個の標本の平均が100、標準偏差が15で、**95%**の信頼度(臨界値z=1.96)の場合:
- 標準誤差: 。
- 誤差の範囲: 。
- 信頼区間: 。
つまり、真の母集団平均は(95%の信頼度で)おそらく94.12から105.88の間のどこかにあります。
知っておくべき重要なポイント
- 信頼区間は、標本がどのように収集されたかについては何も語りません。 ここでの計算は、標本が母集団を真にランダムかつ代表的に反映したものであることを前提としています — 偏った、あるいは非ランダムな抽出方法は、見た目は正確でも中心がまったく間違った値になる信頼区間を生み出すことがあり、この公式ではその問題を検出したり修正したりできません。
- この区間は、元のデータが少なくともおおむね正規分布に従うか、標本が中心極限定理を適用できるほど十分大きいことを前提としています。 大きく歪んだ分布からの小さな標本では、z分布とt分布のどちらの近似も信頼性が低くなります。
- 世論調査やアンケートで報告される信頼区間と誤差の範囲は、同じ基本的な考え方を表しています。 「誤差の範囲はプラスマイナス3パーセントポイント」という報道は、示された信頼度(多くの場合95%)で、この計算機が計算するのとまったく同じ区間を、別の言い方で表しているだけです。
- 信頼度を犠牲にしてまで区間を狭くすることが常に良いわけではありません。 より低い信頼度(例えば95%ではなく80%)でのより狭い区間はより正確ですが、実際に真の値を含んでいる可能性は低くなります — 精度と信頼度の適切なトレードオフは、その見積もりが何のために使われるかによって決まります。
よくある間違い
- 「95%信頼」を「真の平均がこの区間に入る確率が95%」と読み取ること。 標本が実際に収集され区間が計算された時点で、真の母集団平均はその中にあるかないかのどちらかです — もはや語るべき確率は残っていません。95%という数字は、この1つの特定の結果ではなく、何度も繰り返された標本抽出における「方法」自体の長期的な挙動を表しています。
- 前提条件を確認せずに、このz分布に基づく公式を小さな標本に適用すること。 z分布は、大きな標本(慣例的にnが約30以上)か、既知の母集団標準偏差のいずれかを前提としています。標準偏差が推定値でしかない小さな標本では、技術的にはt分布を使うべきで、その場合はやや広い — そしてより正直な — 区間になります。
- 信頼区間を生データの範囲と混同すること。 区間は母集団平均に関する不確実性を表すものであり、個々のデータ点がどこに位置するかを示すものではありません — データセット自体は信頼区間よりもはるかに広く散らばった値を持つことがあり、それでも平均自体の区間は、特に大きな標本では狭いままです。
知っておくと役立つこと
標準誤差は標本サイズそのものではなく標本サイズの平方根に応じて縮小するため、誤差の範囲を半分にするには一般に標本サイズを単に2倍にするのではなく、およそ4倍にする必要があります — これは、調査や実験に実際にどれくらいの規模が必要かを計画する際に重要な点です。これはまた、回答者数がわずか数百人程度の世論調査でも、それなりに狭い誤差の範囲を報告できる理由でもあります。標本が数百人に達すると、平方根の関係により、追加の回答者が1人増えるごとに得られる精度は次第に小さくなっていくため、世論調査担当者は誤差をわずかな端数だけ削るために標本サイズを数万人規模にまで増やす価値をほとんど見出しません。