Kleinste-Kwadratenregressie

Berekeningen Vergelijken

Downloads

Bevat je invoer en resultaten voor deze berekening, plus alle extra berekeningen die je hebt vergeleken.

Een Lijn Passen op Verspreide Datapunten

Kleinste-kwadratenregressie vindt de enige rechte lijn die het beste past bij een spreiding van datapunten. Voer een lijst van x, y-paren in — één per regel — en deze rekenmachine vindt de helling en het snijpunt van de lijn, samen met hoe strak de punten die lijn daadwerkelijk volgen.

De Formule

m=nxyxynx2(x)2\vC{m} = \frac{n\sum{xy} - \sum{x}\sum{y}}{n\sum{x^2} - \left(\sum{x}\right)^2} b=ymxn\vC{b} = \frac{\sum{y} - m\sum{x}}{n}

waarbij mm de helling is, bb het snijpunt, en nn het aantal datapunten — samen beschrijven ze de lijn y=mx+by = mx + b die de totale gekwadrateerde afstand van elk punt tot de lijn minimaliseert.

Uitgewerkt Voorbeeld

Een lijn passen door (1, 1), (2, 2) en (3, 4):

    1. m=3(17)6(7)3(14)62=51424236=96=1,5m = \frac{3(17) - 6(7)}{3(14) - 6^2} = \frac{51 - 42}{42 - 36} = \frac{9}{6} = \vC{1,5}
    2. b=71,5(6)3=793=0,667b = \frac{7 - 1,5(6)}{3} = \frac{7 - 9}{3} = \vC{-0,667} — de gepaste lijn is dus y=1,5x0,667y = 1,5x - 0,667, met een correlatiecoëfficiënt van ongeveer 0,980,98.

Belangrijke Factoren Om Te Overwegen

  • Een sterke correlatiecoëfficiënt betekent niet noodzakelijk dat x daadwerkelijk y veroorzaakt. Twee variabelen kunnen sterk gecorreleerd zijn omdat de ene daadwerkelijk de andere beïnvloedt, omdat beide worden aangedreven door een derde factor, of puur toevallig in een kleine dataset — correlatie beschrijft de sterkte van een lineair verband, niet de reden erachter.
  • Deze methode gaat ervan uit dat het werkelijke verband lineair is, wat niet altijd de juiste aanname is. Als een spreiding van punten eigenlijk een kromme volgt, kan het doorheen forceren van een rechte lijn een technisch “best passende” lijn opleveren die de data toch slecht beschrijft — de punten eerst visueel uitzetten voordat je de fit vertrouwt is goede praktijk.
  • Eén ongewoon punt (een uitschieter) kan de gepaste lijn onevenredig naar zich toe trekken. Omdat kleinste kwadraten GEKWADRATEERDE afstanden minimaliseert, draagt een punt ver van de algemene trend veel meer bij aan de fit dan een punt dichtbij — een kleine dataset met één extreme uitschieter is hier bijzonder gevoelig voor.
  • Meer datapunten leveren over het algemeen een betrouwbaardere fit op, bij verder gelijke omstandigheden. Een lijn gepast door slechts 3-4 punten (zoals in het uitgewerkte voorbeeld) kan overtuigend lijken maar draagt veel meer onzekerheid dan hetzelfde verband gemeten over tientallen punten — correlatiesterkte alleen legt niet vast hoeveel data de fit daadwerkelijk ondersteunt.

Veelgemaakte Fouten

  • Een hoge correlatiecoëfficiënt behandelen als bewijs van causaliteit. Een sterke r-waarde toont alleen dat de punten strak rond een lijn clusteren — het zegt niets over of de ene variabele daadwerkelijk veranderingen in de andere veroorzaakt.
  • Een rechte lijn passen op data die eigenlijk gebogen is. Kleinste kwadraten geeft altijd een helling en snijpunt terug, zelfs wanneer een lineaire fit het onderliggende patroon slecht beschrijft — zet de punten eerst uit, of controleer of de correlatiecoëfficiënt verrassend laag is, voordat je het resultaat vertrouwt.
  • Te weinig datapunten gebruiken en de fit als betrouwbaar behandelen. Een lijn door slechts 3-4 punten kan overtuigend lijken maar draagt veel meer onzekerheid dan hetzelfde verband gemeten over tientallen punten.
  • Eén uitschieter ongemerkt de fit laten domineren. Omdat kleinste kwadraten gekwadrateerde afstanden minimaliseert, kan één ver afgelegen punt de hele lijn naar zich toe trekken — het is de moeite waard om te controleren of het verwijderen van een ongewoon punt het resultaat substantieel verandert.

Goed Om Te Weten

  • Moet je een waarde tussen twee bekende punten schatten in plaats van een trendlijn door veel punten te passen? De Lineaire Interpolatie Calculator behandelt dat directere geval.
  • Wil je zien hoe één specifieke waarde zich verhoudt tot de algehele spreiding van een dataset? De Z-Score Calculator meet precies dat.
  • Werk je met dezelfde lijst getallen voor bredere samenvattende statistieken? De Statistiek Calculator behandelt gemiddelde, mediaan, en standaardafwijking.

Bron: Enkelvoudige Lineaire Regressie.

Veelgestelde Vragen

Wat is kleinste-kwadratenregressie?

Kleinste-kwadratenregressie vindt de enige rechte lijn die het beste past bij een spreiding van datapunten, door de som van de gekwadrateerde verticale afstanden tussen elk punt en de lijn te minimaliseren. Het is de standaardmethode om een lineair verband tussen twee variabelen te beschrijven.

Wat betekenen de helling en het snijpunt?

De helling vertelt je hoeveel y verandert bij elke toename van x met 1 eenheid -- een helling van 2 betekent dat y met 2 stijgt telkens wanneer x met 1 stijgt. Het snijpunt is de voorspelde y-waarde van de lijn wanneer x gelijk is aan 0, dat wil zeggen waar de lijn de verticale as kruist.

Wat vertelt de correlatiecoëfficiënt (r) mij?

De correlatiecoëfficiënt loopt van -1 tot 1 en meet hoe strak de punten zich rond de gepaste lijn groeperen. Een waarde dicht bij 1 betekent een sterk positief verband (als x stijgt, stijgt y ook betrouwbaar), dicht bij -1 betekent een sterk negatief verband, en dicht bij 0 betekent weinig tot geen lineair verband. R-kwadraat (r²) is gewoon r vermenigvuldigd met zichzelf, en wordt vaak gelezen als "het percentage van de variatie in y dat wordt verklaard door x".

Betekent een sterke correlatie dat x y veroorzaakt?

Nee — correlatie meet alleen hoe sterk twee variabelen samen bewegen, niet waarom. Een sterke correlatie kan echte causaliteit weerspiegelen, een gedeelde onderliggende oorzaak die beide variabelen beïnvloedt, of puur toeval, vooral in een kleine dataset. Behandel een hoge correlatiecoëfficiënt alleen niet als bewijs van een causaal verband.

Wat als mijn data eigenlijk geen rechte lijn volgt?

Kleinste-kwadratenregressie past altijd een rechte lijn, zelfs bij data die daadwerkelijk een kromme volgt — het geeft nog steeds een helling, snijpunt, en correlatiecoëfficiënt terug, maar die kunnen het verband slecht beschrijven. Je punten eerst uitzetten, of controleren of de correlatiecoëfficiënt onverwacht laag is, kan aangeven wanneer een lineaire fit het verkeerde hulpmiddel is voor jouw data.

Bevestig je leeftijd

Om een account aan te maken, geef je geboortemaand en -jaar op.