Tilpasning af en Linje til Spredte Datapunkter
Mindste kvadraters regression finder den ene rette linje, der bedst passer til en spredning af datapunkter. Indtast en liste af x, y-par — ét pr. linje — og denne beregner finder linjens hældning og skæringspunkt, samt hvor tæt punkterne rent faktisk følger den linje.
Formlen
hvor er hældningen, er skæringspunktet, og er antallet af datapunkter — sammen beskriver de linjen , der minimerer den samlede kvadrerede afstand fra hvert punkt til linjen.
Løst Eksempel
Tilpasning af en linje gennem (1, 1), (2, 2) og (3, 4):
- — den tilpassede linje er derfor , med en korrelationskoefficient på omkring .
Vigtige Faktorer At Overveje
- En stærk korrelationskoefficient betyder ikke nødvendigvis, at x faktisk forårsager y. To variable kan være stærkt korrelerede, fordi den ene reelt påvirker den anden, fordi begge drives af en tredje faktor, eller rent ved tilfældighed i et lille datasæt — korrelation beskriver styrken af en lineær sammenhæng, ikke årsagen bag den.
- Denne metode antager, at den sande sammenhæng er lineær, hvilket ikke altid er den rigtige antagelse. Hvis en spredning af punkter faktisk følger en kurve, kan det at tvinge en ret linje igennem den producere en teknisk “bedst tilpasset” linje, der stadig beskriver dataene dårligt — det er god praksis at plotte punkterne visuelt, inden man stoler på tilpasningen.
- Et enkelt usædvanligt punkt (en afviger) kan trække den tilpassede linje uforholdsmæssigt meget mod sig. Fordi mindste kvadraters metode minimerer KVADREREDE afstande, bidrager et punkt langt fra den generelle tendens meget mere til tilpasningen end et punkt tæt på den — et lille datasæt med én ekstrem afviger er særligt sårbart over for dette.
- Flere datapunkter giver generelt en mere pålidelig tilpasning, alt andet lige. En linje tilpasset gennem kun 3-4 punkter (som i det løste eksempel) kan se overbevisende ud, men bærer meget mere usikkerhed end den samme sammenhæng målt på tværs af dusinvis af punkter — korrelationsstyrken alene fanger ikke, hvor meget data der reelt understøtter tilpasningen.
Almindelige Fejl
- At behandle en høj korrelationskoefficient som bevis på årsagssammenhæng. En stærk r-værdi viser kun, at punkterne klumper sig tæt sammen omkring en linje — den siger intet om, hvorvidt den ene variabel faktisk forårsager ændringer i den anden.
- At tilpasse en ret linje til data, der faktisk er kurvet. Mindste kvadraters metode returnerer altid en hældning og et skæringspunkt, selv når en lineær tilpasning beskriver det underliggende mønster dårligt — plot punkterne først, eller tjek om korrelationskoefficienten er overraskende lav, før du stoler på resultatet.
- At bruge for få datapunkter og behandle tilpasningen som pålidelig. En linje gennem bare 3-4 punkter kan se overbevisende ud, men bærer langt mere usikkerhed end den samme sammenhæng målt på tværs af dusinvis af punkter.
- At lade en enkelt afviger dominere tilpasningen uden at bemærke det. Fordi mindste kvadraters metode minimerer kvadrerede afstande, kan ét fjerntliggende punkt trække hele linjen mod sig — det er værd at tjekke, om fjernelse af et usædvanligt punkt ændrer resultatet væsentligt.
Godt At Vide
- Har du brug for at estimere en værdi mellem to kendte punkter i stedet for at tilpasse en trendlinje gennem mange? Lineær Interpolation Beregner dækker det mere direkte tilfælde.
- Vil du se, hvordan én bestemt værdi sammenlignes med den samlede spredning af et datasæt? Z-Score Beregner måler netop det.
- Arbejder du med den samme liste af tal for bredere opsummerende statistik? Statistik Beregner dækker gennemsnit, median, og standardafvigelse.