Å Konvertere en Z-Skår til en Sannsynlighet for Tilfeldighet
En p-verdi er sannsynligheten for å se et resultat minst like ekstremt som det observerte, rent ved tilfeldighet, hvis det faktisk ikke var noen reell effekt. Angi en z-skår og velg en testtype, og denne kalkulatoren konverterer den til en p-verdi — standardtallet brukt til å avgjøre om et resultat er statistisk signifikant. Hvis du har rå prøvedata i stedet for en allerede beregnet z-skår, finn den først med Z-Score-kalkulator.
En mindre p-verdi betyr at det observerte resultatet ville være mindre sannsynlig å skje ved tilfeldighet alene, som er sterkere bevis mot antakelsen om at ingenting reelt foregår («nullhypotesen»). Etter en langvarig konvensjon på tvers av de fleste fagfelt behandles en p-verdi under 0,05 generelt som statistisk signifikant — men den terskelen er en konvensjon, ikke en naturlov, og hva som regnes som «signifikant nok» kan variere etter fagfelt og hvor kostbar en feil konklusjon ville være.
Formelen
For en venstresidig test (er resultatet uvanlig lavt?):
For en høyresidig test (er resultatet uvanlig høyt?):
For en tosidig test (er resultatet uvanlig i begge retninger?):
Hvor er z-skåren og er normalfordelingens kumulative fordelingsfunksjon — sannsynligheten for at en tilfeldig trukket verdi fra den fordelingen faller ved eller under et gitt punkt, beregnet her via en veletablert polynomapproksimasjon av feilfunksjonen.
Regneeksempel
- En z-skår på 1,96 er lærebokreferansepunktet for en tosidig test ved den konvensjonelle 95%-konfidensnivået: . 2. En p-verdi på omtrent 0,05 ligger rett på den konvensjonelle signifikansterskelen. 3. En større z-skår på 2,576 (det tosidige referansepunktet for 99% konfidens) gir en mindre, mer signifikant p-verdi på omtrent 0,0100.
Viktige Faktorer å Vurdere
- En p-verdi forteller deg IKKE sannsynligheten for at nullhypotesen er sann. Dette er en av de vanligste feiltolkningene innen statistikk — en p-verdi på 0,03 betyr at det er en 3% sjanse for å se et resultat så ekstremt (eller mer ekstremt) HVIS nullhypotesen VAR sann, ikke en 3% sjanse for at nullhypotesen faktisk er korrekt.
- En ensidig og en tosidig test på samme z-skår gir forskjellige p-verdier, og å velge feil kan villede. En ensidig test sjekker bare for en effekt i én spesifikk retning, mens en tosidig test sjekker for en effekt i begge retninger — valget bør avgjøres basert på det faktiske forskningsspørsmålet FØR man ser på dataene, ikke velges i etterkant for å produsere en mer gunstig-utseende p-verdi.
- Statistisk signifikans og praktisk signifikans er to forskjellige ting. Med et stort nok utvalg kan selv en liten, praktisk talt betydningsløs effekt produsere en svært liten p-verdi — et statistisk signifikant resultat er ikke automatisk en viktig eller stor reell effekt, og effektstørrelse bør vurderes sammen med p-verdien.
- Den konvensjonelle 0,05-terskelen er en mye brukt konvensjon, ikke en universell vitenskapelig lov. Enkelte fagfelt (som partikkelfysikk) krever langt strengere terskler før man erklærer en oppdagelse, mens andre behandler 0,05 som en rimelig standard — hva som regnes som «signifikant nok» avhenger av fagfeltet og kostnaden ved å ta feil.
Vanlige Feil
- Å avgjøre testtypen etter å ha sett resultatene. Valget mellom en ensidig og tosidig test bør følge av det faktiske forskningsspørsmålet, avgjort før dataene er tilgjengelige — å bytte til hvilken som helst test som gir en mindre p-verdi i ettertid, er en form for datamanipulasjon, selv om den er utilsiktet.
- Å rapportere en p-verdi uten noe mål på effektstørrelse. En p-verdi forteller bare hvor usannsynlig et resultat er under nullhypotesen — den sier ingenting om hvor stort eller meningsfullt det resultatet faktisk er, som er grunnen til at en p-verdi vanligvis rapporteres sammen med et konfidensintervall eller en effektstørrelse, ikke alene.
- Å behandle p = 0,049 og p = 0,051 som grunnleggende forskjellige resultater. 0,05-grensen er en konvensjon, ikke en skarp linje i naturen — to så nære resultater er praktisk talt identiske i bevisstyrke, selv om det ene teknisk sett klarer terskelen og det andre ikke.
- Å kjøre mange tester og bare rapportere de som viste seg signifikante. Å teste nok sammenligninger vil til slutt avdekke et «signifikant» resultat ved ren tilfeldighet — betydningen av en p-verdi forutsetter en enkelt, forhåndsplanlagt test, ikke det beste resultatet valgt blant mange.
Godt Å Vite
- Starter du fra rå prøvedata i stedet for en allerede kjent z-skår? Z-Score-kalkulator konverterer en rå verdi mot et kjent gjennomsnitt og standardavvik til z-skåren denne kalkulatoren trenger.
- Vil du ha et spekter av sannsynlige verdier i stedet for en enkelt signifikansdom? Konfidensintervall-kalkulator uttrykker usikkerhet som et intervall, en vanlig ledsager til en p-verdi snarere enn en erstatning for den.
- Trenger du først sammendragsstatistikk — gjennomsnitt, standardavvik, varians — fra en rå liste med tall? Statistikkalkulator beregner dem direkte fra dataene dine.