설문조사에 필요한 최소 표본 크기 구하기
표본 크기 결정은 선택한 오차범위와 신뢰수준 내에서 모집단의 비율을 추정하기 위해 설문조사에 몇 명의 응답자나 관측치가 필요한지를 구합니다. 신뢰수준과 원하는 오차범위, 그리고(있다면) 예상 비율을 선택하면 이 계산기가 응답을 단 하나도 수집하기 전에 필요한 최소 표본 크기를 구해 줍니다.
이는 신뢰구간 계산기 자체의 질문보다 앞서 오는 질문입니다 — 그 계산기는 이미 수집한 데이터가 얼마나 넓은 구간을 만들어냈는지 알려주지만, 이 계산기는 결과 구간이 감당할 수 있는 만큼보다 넓어지지 않도록 애초에 얼마나 많은 데이터를 수집해야 하는지 알려줍니다.
알려진 모집단 크기(설문 대상이 될 수 있는 전체 인원 또는 항목 수)가 있다면, 이를 입력하면 유한모집단 보정이 적용되어 모집단 자체가 작을 때 필요한 표본을 의미 있게 줄일 수 있습니다. 크거나 알 수 없는 모집단을 가정하려면 비워 두세요 — 더 안전하고 더 흔한 경우입니다.
계산식
여기서 는 선택한 신뢰수준에 대한 임계값, 는 예상 비율(소수로 표현), 는 원하는 오차범위(소수로 표현)입니다. 표본은 응답자의 일부만 포함할 수 없으므로 결과는 올림합니다.
모집단 크기 을 알고 있을 때는 유한모집단 보정이 적용됩니다:
(50%)는 실제 비율을 모를 때 가장 보수적인 선택입니다 — 는 정확히 50%에서 최댓값을 가지므로, 필요한 표본 크기를 최대화(즉, 절대 과소평가하지 않게)합니다.
계산 예시
95% 신뢰수준(z = 1.96), 원하는 오차범위 ±5%, 예상 비율 50%(보수적인 기본값)일 때:
- z를 제곱하고 p(1-p)를 곱하기: . 2. e의 제곱으로 나누기: . 3. 표본은 응답자의 일부만 포함할 수 없으므로 올림: .
크거나 알 수 없는 모집단이라면 385명의 응답자가 필요합니다. 만약 실제 모집단이 1,000명뿐 이라면, 유한모집단 보정으로 이 숫자는 다음과 같이 줄어듭니다:
- n0에서 1을 빼고 모집단으로 나누기: .
- 1을 더하기: .
- n0을 그 결과로 나누기: .
모집단이 그 정도로 작다는 것을 알고 나면 단 278명의 응답자만 필요합니다.
고려해야 할 주요 요소
- 원하는 오차범위를 줄이면 표본 크기는 비례적으로가 아니라 불균형적으로 훨씬 더 커집니다. 오차범위가 공식의 분모에서 제곱으로 나타나기 때문에, 오차범위를 절반으로 줄이면 필요한 표본 크기는 대략 4배로 늘어납니다 — 이것이 바로 (±1%처럼) 매우 좁은 오차범위가 일반적인 ±5%보다 훨씬 더 많은 응답자를 요구하는 이유입니다.
- 더 높은 신뢰수준도 필요한 표본을 늘리지만, 오차범위를 좁히는 것만큼 극적이지는 않습니다. 90%에서 95%, 99%로 신뢰수준을 올리면 공식에 쓰이는 임계 z값이 커져 필요한 표본 크기가 늘어납니다 — 신뢰수준과 표본 크기 사이의 정확한 절충은 고정된 규칙이 아니라 실제로 계획 단계에서 내려야 할 결정입니다.
- 이 공식은 (예: “사람들 중 몇 퍼센트가 X를 선호하는가” 같은) 단일 비율을 추정하기 위한 표본 크기를 구하며, 모든 종류의 통계적 질문에 적용되지는 않습니다. (평균 지출액 같은) 수치 평균을 추정하거나 두 그룹 간의 차이를 검출하는 것은 각각 관련은 있지만 다른 표본 크기 공식을 사용합니다 — 이 계산기는 가장 흔한 설문조사 시나리오인 비율 추정 사례에 특화되어 있습니다.
- 유한모집단 보정은 모집단 자체가 상대적으로 작을 때만 필요한 표본을 의미 있게 줄여 줍니다. (수만 명 이상의) 큰 모집단에서는 이 보정이 필요한 표본 크기에 미치는 영향이 미미합니다 — 이것이 바로 설문조사 방법론에서 “큰 모집단”과 “알 수 없는 모집단”을 흔히 사실상 같은 경우로 취급하며, 둘 다 보정하지 않은 공식을 기본값으로 사용하는 이유입니다.
흔히 하는 실수
- 모집단 크기를 연락할 계획인 인원 수로 입력하는 것(실제로 표본을 추출할 전체 모집단이 아니라). 유한모집단 보정은 설문조사가 가능한 전체 그룹(예: 어느 회사의 전체 직원 1,000명)에만 적용됩니다 — 얻고자 하는 응답 수를 입력하면 이 계산의 목적이 무의미해집니다.
- 오차범위가 작으면 표본도 약간만 더 커지면 된다고 가정하는 것. 오차범위는 공식에서 제곱으로 나타나기 때문에, 이를 절반으로 줄이면 필요한 표본은 대략 4배가 됩니다 — 표본 크기 비용을 고려하지 않고 좁은 오차범위를 계획하는 것은 흔한 놀라움으로 이어집니다.
- 이 계산기를 신뢰구간 계산기와 혼동하는 것. 이 계산기는 “데이터를 수집하기 전에 몇 명의 응답자가 필요한가”에 답하고, 다른 계산기는 “이미 수집한 데이터가 얼마나 정확했는가”에 답합니다 — 둘은 반대 방향으로 작동하며 서로 대체할 수 없습니다.