최소제곱회귀

계산 비교

다운로드

이번 계산의 입력값과 결과, 그리고 비교하신 추가 계산이 모두 포함됩니다.

흩어진 데이터 점에 직선 맞추기

최소제곱회귀는 데이터 점들의 산포에 가장 잘 맞는 유일한 직선을 찾습니다. x, y 쌍의 목록을 한 줄에 하나씩 입력하면, 이 계산기는 직선의 기울기와 절편, 그리고 점들이 실제로 그 직선을 얼마나 밀접하게 따르는지를 구합니다.

계산식

m=nxyxynx2(x)2\vC{m} = \frac{n\sum{xy} - \sum{x}\sum{y}}{n\sum{x^2} - \left(\sum{x}\right)^2} b=ymxn\vC{b} = \frac{\sum{y} - m\sum{x}}{n}

여기서 mm은 기울기, bb는 절편, nn은 데이터 점의 개수입니다 — 이들을 함께 사용 하여 각 점에서 직선까지의 제곱 거리의 합을 최소화하는 직선 y=mx+by = mx + b를 표현합니다.

계산 예시

(1, 1), (2, 2), **(3, 4)**를 지나는 직선 맞추기:

    1. m=3(17)6(7)3(14)62=51424236=96=1.5m = \frac{3(17) - 6(7)}{3(14) - 6^2} = \frac{51 - 42}{42 - 36} = \frac{9}{6} = \vC{1.5}

    2. b=71.5(6)3=793=0.667b = \frac{7 - 1.5(6)}{3} = \frac{7 - 9}{3} = \vC{-0.667} — 따라서 맞춘 직선은 y=1.5x0.667y = 1.5x - 0.667이며, 상관 계수는 약 0.980.98입니다.

고려해야 할 주요 요소

  • 강한 상관 계수가 반드시 x가 y를 유발한다는 의미는 아닙니다. 두 변수는 하나가 실제로 다른 하나에 영향을 미치기 때문에, 둘 다 제3의 요인에 의해 움직이기 때문에, 또는 작은 데이터셋에서 순전히 우연으로 강한 상관관계를 보일 수 있습니다 — 상관관계는 선형 관계의 강도를 나타낼 뿐, 그 이유를 설명하지는 않습니다.
  • 이 방법은 실제 관계가 선형이라고 가정하는데, 항상 옳은 가정은 아닙니다. 점들의 산포가 실제로 곡선을 따른다면, 강제로 직선을 맞추면 기술적으로는 “최적 적합”이지만 데이터를 제대로 설명하지 못하는 직선이 나올 수 있습니다 — 적합을 신뢰하기 전에 점들을 시각적으로 그려보는 것이 좋은 습관입니다.
  • 하나의 특이한 점(이상치)이 맞춘 직선을 불균형하게 끌어당길 수 있습니다. 최소제곱법은 거리의 제곱을 최소화하기 때문에, 전체적인 추세에서 멀리 떨어진 점은 가까운 점보다 적합에 훨씬 더 큰 영향을 미칩니다 — 극단적인 이상치가 하나 있는 소규모 데이터셋은 이에 특히 민감합니다.
  • 다른 조건이 같다면 데이터 점이 많을수록 일반적으로 더 신뢰할 수 있는 적합이 나옵니다. 단 3~4개의 점(계산 예시처럼)만으로 맞춘 직선은 그럴듯해 보일 수 있지만, 수십 개의 점으로 측정된 동일한 관계보다 훨씬 더 큰 불확실성을 가집니다 — 상관관계의 강도만으로는 그 적합을 실제로 뒷받침하는 데이터의 양을 알 수 없습니다.

흔한 실수

  • 높은 상관 계수를 인과관계의 증거로 취급하는 것. 강한 r값은 점들이 직선 주위에 밀접하게 모여 있다는 것만 보여줄 뿐입니다 — 한 변수가 실제로 다른 변수의 변화를 유발하는지에 대해서는 아무것도 말해주지 않습니다.
  • 실제로는 곡선인 데이터에 직선을 맞추는 것. 최소제곱법은 선형 적합이 기저 패턴을 제대로 설명하지 못하는 경우에도 항상 기울기와 절편을 반환합니다 — 결과를 신뢰하기 전에 먼저 점들을 그려보거나 상관 계수가 예상외로 낮지 않은지 확인하세요.
  • 데이터 점이 너무 적은데도 적합을 신뢰할 수 있는 것으로 취급하는 것. 단 3~4개의 점만 지나는 직선은 그럴듯해 보일 수 있지만, 수십 개의 점으로 측정된 동일한 관계보다 훨씬 더 큰 불확실성을 가집니다.
  • 눈치채지 못한 채 하나의 이상치가 적합을 지배하도록 두는 것. 최소제곱법은 제곱 거리를 최소화하기 때문에, 멀리 떨어진 점 하나가 전체 직선을 그쪽으로 끌어당길 수 있습니다 — 특이한 점을 제거했을 때 결과가 크게 바뀌는지 확인해 볼 가치가 있습니다.

알아두면 유용한 정보

  • 많은 점을 지나는 추세선을 맞추는 대신 두 알려진 점 사이의 값을 추정해야 하나요? 선형 보간 계산기가 그 더 직접적인 경우를 다룹니다.
  • 특정 값이 데이터셋의 전체 분포와 어떻게 비교되는지 보고 싶으신가요? Z-점수 계산기가 정확히 그것을 측정합니다.
  • 더 폭넓은 요약 통계를 위해 같은 숫자 목록으로 작업하고 계신가요? 통계 계산기가 평균, 중앙값, 표준편차를 다룹니다.

출처: 단순 선형 회귀.

자주 묻는 질문

최소제곱회귀란 무엇인가요?

최소제곱회귀는 각 점과 직선 사이의 수직 거리 제곱의 합을 최소화하여 데이터 점들의 산포에 가장 잘 맞는 단일 직선을 찾습니다. 이는 두 변수 간의 선형 관계를 설명하는 표준 방법입니다.

기울기와 절편은 무슨 의미인가요?

기울기는 x가 1단위 증가할 때마다 y가 얼마나 변하는지를 알려줍니다 -- 기울기가 2라는 것은 x가 1씩 증가할 때마다 y가 2씩 증가한다는 의미입니다. 절편은 x가 0일 때 직선이 예측하는 y 값으로, 직선이 수직축과 교차하는 지점입니다.

상관 계수(r)는 무엇을 알려주나요?

상관 계수는 -1에서 1까지의 범위를 가지며, 점들이 적합된 직선 주위에 얼마나 밀집되어 있는지를 측정합니다. 1에 가까운 값은 강한 양의 관계를 의미하고(x가 증가하면 y도 확실히 증가), -1에 가까운 값은 강한 음의 관계를 의미하며, 0에 가까운 값은 선형 관계가 거의 또는 전혀 없음을 의미합니다. 결정 계수(r²)는 단순히 r을 자기 자신과 곱한 것으로, 흔히 'y의 변동 중 x로 설명되는 비율'로 해석됩니다.

강한 상관관계는 x가 y를 유발한다는 뜻인가요?

아닙니다 — 상관관계는 두 변수가 얼마나 강하게 함께 움직이는지만 측정할 뿐, 그 이유는 알려주지 않습니다. 강한 상관관계는 실제 인과관계를 반영할 수도 있고, 두 변수에 모두 영향을 미치는 공통 원인을 반영할 수도 있으며, 특히 작은 데이터셋에서는 단순한 우연일 수도 있습니다. 높은 상관 계수 하나만으로 인과관계의 증거로 여기지 마세요.

데이터가 실제로 직선을 따르지 않으면 어떻게 되나요?

최소제곱회귀는 실제로 곡선을 따르는 데이터에 대해서도 항상 직선을 맞춥니다 -- 여전히 기울기, 절편, 상관 계수를 반환하지만, 이 값들이 관계를 제대로 설명하지 못할 수 있습니다. 먼저 점들을 그래프로 그려보거나 상관 계수가 예상보다 낮은지 확인하면 선형 적합이 데이터에 적합하지 않은 도구인지를 파악하는 데 도움이 됩니다.

나이를 확인해 주세요

계정을 만들려면 출생 월과 연도를 알려주세요.