평균, 중앙값, 최빈값, 산포도 구하는 방법
이 계산기는 어떤 숫자 목록이든 평균, 중앙값, 최빈값, 범위, 분산, 표준편차를 구합니다. 아래 입력창에 숫자를 붙여넣거나 입력하세요 — 쉼표, 공백, 줄바꿈으로 구분하며 어떤 조합이든 상관없습니다 — 그러면 일반적인 기술통계량이 한 번에 모두 계산됩니다.
평균은 산술평균입니다. 중앙값은 숫자들을 정렬했을 때 가운데에 오는 값입니다(목록의 개수가 짝수라면 가운데 두 값의 평균). 최빈값은 가장 자주 나타나는 값(또는 값들)입니다 — 모든 숫자가 정확히 한 번씩만 나타난다면 최빈값은 없습니다.
표준편차는 숫자들이 평균으로부터 얼마나 흩어져 있는지를 나타냅니다 — 표준편차가 작으면 숫자들이 서로 가까이 모여 있다는 뜻이고, 크면 넓게 퍼져 있다는 뜻입니다. 이 계산기는 이를 두 가지 방식으로 보여줍니다: 모표준편차(입력한 숫자들이 관심 대상 집단 전체인 경우)와 표본표준편차(입력한 숫자들이 더 큰 모집단을 추정하기 위한 표본인 경우) — 표본표준편차가 약간 더 큰데, 이는 표본이 전체 모집단의 실제 분산을 과소평가하는 경향을 보정하기 때문입니다.
계산식
사용하는 분산에 따라 모집단 또는 표본 표준편차가 됩니다.
모집단 버전과 표본 버전의 유일한 차이는 개수 그 자체로 나누느냐, 개수에서 1을 뺀 값(베셀의 보정으로 알려짐)으로 나누느냐입니다 — 나머지는 모두 동일합니다.
계산 예시
숫자 2, 4, 4, 4, 5, 5, 7, 9의 경우:
- 개수: . 합계: . 평균:
- 정렬 후: 2, 4, 4, 4, 5, 5, 7, 9 — 중앙값은 가운데 두 값(4와 5)의 평균입니다:
- 최빈값: 4(세 번 나타나 다른 어떤 값보다도 많습니다)
- 범위:
- 모표준편차: 2.0. 표본표준편차: 약 2.14
고려해야 할 주요 요소
- 데이터셋에 이상치가 있거나 왜곡되어 있으면 평균과 중앙값이 매우 다른 이야기를 들려줄 수 있습니다. 매우 크거나 작은 단 하나의 값이 평균을 그쪽으로 끌어당기는 반면, 중앙값은 극단적인 값과 무관하게 정렬된 데이터의 가운데에 고정되어 있습니다 — 이것이 바로 예를 들어 가구 중위소득이 평균소득 대신(또는 함께) 흔히 보고되는 이유입니다. 소수의 매우 높은 소득이 아니면 평균을 위로 왜곡시킬 것이기 때문입니다.
- 모표준편차와 표본표준편차 중 무엇을 선택할지는 전적으로 선호가 아니라 본인의 숫자가 실제로 무엇을 나타내는지에 달려 있습니다. 입력한 숫자가 관심 대상 집단 전체(특정 학급의 모든 학생)라면 모집단을 사용하세요. 그것들이 더 큰 집단을 추정하기 위한 표본(전체 고객을 대표하기 위한 일부 고객 설문)이라면 표본을 사용하세요 — 잘못된 쪽을 선택하면 실제 변동성을 체계적으로 과소평가하거나 과대평가하게 됩니다.
- 평균과 중앙값은 항상 단일 값인 것과 달리, 데이터셋은 최빈값이 없을 수도, 하나일 수도, 여러 개일 수도 있습니다. 목록의 모든 값이 정확히 한 번씩만 나타나면 최빈값은 아예 없습니다 — 그리고 둘 이상의 값이 가장 자주 나타나는 빈도로 동률이라면 데이터셋은 실제로 “이봉형” 또는 “다봉형”일 수 있는데, 이는 그 자체로 기초 데이터에 대한 의미 있는 신호인 경우가 많습니다.
- 표준편차는 평균의 한 표준편차 이내에 대략 68%의 값이 들어오는, 대략 종 모양(정규) 분포에서 가장 직관적으로 해석됩니다. 심하게 왜곡되어 있거나 매우 다른 모양을 가진 데이터에서도 표준편차는 여전히 유효한 산포 측도이지만, 직관적인 “68-95-99.7 법칙” 백분율이 그렇게 깔끔하게 적용되지는 않습니다.
흔한 실수
- 습관적으로 항상 모표준편차(또는 항상 표본표준편차)를 사용하는 것. 어느 것이 맞는지는 입력한 숫자가 전체 그룹인지 아니면 그중 일부 표본인지에 전적으로 달려 있습니다 — 잘못된 것을 선택하면 나머지 계산을 아무리 신중하게 하더라도 실제 산포도를 체계적으로 과소평가하거나 과대평가하게 됩니다.
- 데이터가 왜곡되어 있을 때 평균을 “전형적인 값”으로 취급하는 것. 비정상적으로 크거나 작은 소수의 숫자가 실제로 대부분의 데이터가 위치한 곳에서 평균을 멀어지게 만듭니다 — 소득이나 주택 가격처럼 왜곡된 데이터에서는 중앙값이 더 정직한 “전형적인 값”인 경우가 많습니다.
- 최빈값이 없거나, 하나이거나, 여러 개일 수 있다는 것을 잊는 것. 모든 데이터셋에 정확히 하나의 최빈값이 있다고 가정하면, 목록에 반복되는 값이 없거나(최빈값 없음) 여러 값이 가장 자주 나타나는 빈도로 동률일 때(다봉형) 혼란이 생깁니다 — 둘 다 정상적이고 예상 가능한 결과이며 오류가 아닙니다.
알아두면 유용한 정보
- 목록에서 계산하는 대신 이미 알고 있는 평균과 표준편차에 대해 값 하나를 표준화해야 하나요? Z-점수 계산기는 단일 값을 z점수와 백분위수로 변환합니다.
- 숫자 두 개만 다루고 있고 전체 기술통계 분석 대신 백분율 차이를 원하시나요? 백분율 오차 계산기와 퍼센트 계산기가 그 더 간단한 경우를 다룹니다.
- 이미 가지고 있는 데이터셋을 설명하는 것을 넘어, 특정 결과가 얼마나 일어날 가능성이 있는지 궁금하신가요? 확률 계산기는 단일 및 복합 사건의 확률을 계산합니다.