信頼区間とサンプルサイズをわかりやすく解説

特定の順序で組み合わさる3つの統計概念 -- 何人を調査すべきか、データが手に入った後の不確実性の幅、そして差が本物なのか単なるノイズなのかを見分ける方法。

信頼区間、サンプルサイズ、p値は統計学の中で最も誤解されやすい3つの概念であり、混乱の大部分は それらが順番にどう組み合わさるかが見えていないことから生じます。 それぞれが本質的に異なる質問 に答えるものであり、特定の順序で進みます:どれだけのデータを収集すべきか、実際に収集したデータ がどれだけ不確実か、そしてそのデータの差が何かを意味するのかどうかです。

データを収集する前に:いくつ必要か

サンプルサイズ計算機

は、たった一つの回答も収集される前に来る最初の質問に答えます:希 望する誤差の範囲と信頼水準が与えられたとき、調査には実際に何人の回答者や観測値が必要か?誤差の 範囲は基礎となる式の中で二乗されるため、希望する誤差の範囲を半分にすると必要なサンプル数は単に 2倍になるのではなく、おおよそ4倍になります — これが、狭い±1%の誤差範囲が典型的な±5%の誤差範囲 よりもはるかに多くの回答者を必要とする理由です。

実用的なポイント: 調査を設計する前に、結果が実際にどれだけ正確である必要があるかを決めてお きましょう、後からではなく — データ収集がすでに始まった後で誤差の範囲を狭めることは、サンプル サイズの決定がすでに(良くも悪くも)下されてしまったことを意味します。

データが手に入った後:不確実性はどれだけ広いか

信頼区間計算機

は、実際のデータが存在するようになったときに、逆の質問に 答えます:サンプルの平均、標準偏差、サイズが与えられたとき、真の母集団の値をおそらく含む範囲は どれだけ広いか?「95%信頼区間」とは、同じサンプリングプロセスを何度も繰り返した場合、生成される 区間の約95%が真の母集団平均を含むという意味です — この特定の一つの区間に真の平均が含まれる確 率が95%であるという意味では「ありません」。これは、この用語を日常的に使う人でさえ混乱させる区 別です。サンプルサイズとの同じ平方根の関係はここにも現れます:サンプルが大きいほど標準誤差(し たがって区間全体)は縮小しますが、区間を再び半分にするには、単に2倍にするのではなく、再びおお よそ4倍のサンプルが必要になります。

実用的なポイント: ニュース報道の「誤差の範囲はプラスマイナス3パーセントポイント」という表 現は、まさにこの同じ区間を、単に言い方を変えて説明しているにすぎません — そして、より低い信頼 水準を犠牲にして得られたのであれば、より狭い区間が自動的に良いわけではありません。精度と信頼性 は互いにトレードオフの関係にあるからです。

差が本物かどうかを判断する

P値計算機

は、本質的に異なる第三の質問に答えます:比較や検定から得られたzスコア が与えられたとき、実際には本当の効果が何もなかったとしたら、これほど極端な結果を純粋に偶然だけ で観測する確率はどれくらいか?慣例的な0.05のしきい値を下回るp値は、一般的に統計的に有意である とみなされます — しかし、そのしきい値は広く使われている慣例であり、自然の法則ではありません。 そして、p値は帰無仮説そのものが正しい確率を示すものでは決してありません。これはよくある、かつ 重大な結果をもたらす誤解です。

実用的なポイント: 統計的有意性と実務的有意性は別のものです — 十分に大きなサンプルがあれ ば、実務上ほとんど意味のない小さな効果でも、非常に小さいp値を生み出すことがあります。そのため、 p値は単独ではなく、信頼区間や効果量とあわせて読むのが最も適切です。

すべてをまとめる

自然な順序は次のとおりです:調査や実験を計画する際には、希望する精度のためにどれだけのデータを 収集すべきかを決めるために サンプルサイズ計算機 を使い、実際のデータが手に入ったら、実 際の不確実性がどれだけの広さになったかを見るために 信頼区間計算機 を実行 し、グループを比較したり特定の仮説を検定したりする際には、観測された差がおそらく本物なのか単な るノイズなのかを判断するために P値計算機 を使います。これら3つのツールは、同じ 統計プロセスの異なる段階に位置しています — どちらがどの段階に当てはまるかを混同すること(デー タを持つ前に信頼区間の質問をしたり、すでにデータを持った後にサンプルサイズの質問をしたりするこ と)は、互いの数値が誤用される最も一般的な方法の一つです。

このガイドで使用する計算機

年齢を確認してください

アカウントを作成するには、生まれた月と年を教えてください。