분포의 평균에 대해 값을 표준화하기
Z-점수는 어떤 값이 분포의 평균보다 표준편차 몇 개만큼 위 또는 아래에 있는지를 나타냅니다. 값과 그 분포의 평균, 표준편차를 입력하면 Z-점수와 그에 대응하는 백분위수 - 즉 정규분포의 몇 퍼센트가 그 값 이하에 위치하는지 - 를 구할 수 있습니다.
Z-점수가 0이면 값이 평균과 정확히 같다는 뜻입니다. 양수 Z-점수는 평균보다 위, 음수 Z-점수는 평균보다 아래에 있습니다. 정규분포에서는 대략 68%가 평균에서 표준편차 1 이내에, 95%가 표준편차 2 이내에, 99.7%가 표준편차 3 이내에 분포하므로, Z-점수 하나만으로도 그 값이 얼마나 특이한지 바로 감을 잡을 수 있습니다.
계산식
백분위수는 표준정규분포의 누적분포함수에서 나옵니다 - 그 분포에서 무작위로 뽑은 값이 입력한 Z-점수 이하일 확률이며, 여기서는 잘 알려진 오차함수의 다항 근사식을 통해 계산됩니다.
계산 예시
IQ 점수가 115이고, IQ 점수의 평균이 100, 표준편차가 15인 경우:
- Z-점수: , 그다음 .
- 백분위수: 정확히 Z-점수 1은 84.13번째 백분위수에 해당합니다 - 이 값은 분포의 약 84%보다 높습니다.
고려해야 할 주요 요소
- 이 계산은 기초 분포가 진짜로 정규(종 모양)라고 가정하며, 모든 실제 데이터셋에 대해 그것이 사실인 것은 아닙니다. (키나 IQ 점수 같은) 많은 실제 측정값은 이것이 잘 작동할 만큼 충분히 정규분포에 가깝지만, 심하게 왜곡되어 있거나 여러 봉우리를 가진 분포는 이 계산기가 의존하는 표준정규곡선으로 백분위수를 정확하게 나타낼 수 없습니다.
- Z-점수는 서로 다른 분포의 값들을 같은 비교 가능한 척도로 표준화합니다. 이것이 바로 서로 다른 평균과 표준편차를 가진 두 측정값 사이에서 한 값의 상대적 위치를 비교하는 데 Z-점수가 유용한 이유입니다 — 예를 들어 채점 방식이 다른 두 시험의 점수를 서로 비교하는 경우입니다.
- 이 계산기는 편측(단측) 백분위수(그 값 이하에 있는 분포의 비율)를 계산하며, 이는 양측(양쪽 꼬리) 확률과는 다릅니다. “나보다 낮은 점수를 받은 비율은 얼마인가”와 “이 값이 어느 방향으로든 얼마나 특이한가” 중 어떤 질문을 하고 있는지에 따라 사용해야 할 수치가 달라질 수 있으므로, 특정 사용 사례에 실제로 필요한 것이 무엇인지 명확히 할 가치가 있습니다.
- Z-점수 계산기와 통계 계산기는 관련은 있지만 실제로 다른 질문에 답합니다. 통계 계산기는 원시 숫자로부터 데이터셋 자체의 평균과 표준편차를 계산하는 반면, 이 계산기는 하나의 값을 이미 알고 있는 분포의 평균 및 표준편차에 대해 채점합니다 — 이 둘은 흔히 함께 사용되어, 먼저 분포의 매개변수를 계산한 다음 개별 값을 그것에 대해 채점합니다.
흔한 실수
- 표본 통계량을 실제 모집단의 평균/표준편차인 것처럼 사용하는 것. 작은 표본에서 추정한 평균과 표준편차는 자체적인 불확실성을 가지고 있습니다 — 이를 정확한 모집단 매개변수로 다루면 백분위수가 실제보다 더 정밀해 보일 수 있습니다.
- 확인 없이 기초 데이터가 정규분포를 따른다고 가정하는 것. 백분위수 변환은 진짜로 종 모양인 데이터에만 성립합니다 — 왜곡되었거나 여러 봉우리를 가진 분포의 경우, 계산된 Z-점수 자체는 여전히 유효하지만, 거기서 나온 백분위수 수치는 심각하게 오해의 소지가 있을 수 있습니다.
- 편측 백분위수를 양측(양쪽 꼬리) 확률과 혼동하는 것. “나보다 낮은 점수를 받은 비율”과 “이 값이 어느 방향으로든 얼마나 특이한가”는 답이 다른 별개의 질문입니다 — 상황에 맞지 않는 것을 사용하면 결과를 잘못 해석하게 됩니다.