Tilbake
2.4
Korrelasjon og regresjon

2.4 Korrelasjon og regresjon

Pearsons r, lineær regresjon, R² og prediksjon.

30 min
5 oppgaver
KorrelasjonRegresjonPrediksjon
Du leser den lesevennlige versjonen
Din fremgang i kapitlet
0 / 5 oppgaver

Henger ting sammen?

T-testene sammenlignet grupper. Men ofte er spørsmålet et annet: henger to tallstørrelser sammen? Er det en sammenheng mellom studietid og eksamensresultat? Mellom temperatur og strømforbruk? Mellom alder og reaksjonstid? Her trenger vi to nye verktøy: korrelasjon, som måler sammenhengen, og regresjon, som modellerer den.

Det første verktøyet er Pearsons korrelasjonskoeffisient rr -- et mål på styrken og retningen til den lineære sammenhengen mellom to kvantitative variabler. Verdien ligger alltid mellom 1-1 og +1+1. Er r=+1r = +1, har du en perfekt positiv sammenheng der begge øker sammen. Er r=1r = -1, er den perfekt negativ -- den ene stiger mens den andre synker. Er r=0r = 0, finnes ingen lineær sammenheng. Tommelregelen for styrke sier at r|r| rundt 0,2-0,4 er svak, 0,4-0,6 moderat, 0,6-0,8 sterk, og over 0,8 svært sterk.

Formelen r=(xixˉ)(yiyˉ)(xixˉ)2(yiyˉ)2\displaystyle r = \frac{\sum(x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum(x_i - \bar{x})^2 \cdot \sum(y_i - \bar{y})^2}} måler i hvilken grad xx og yy varierer sammen (telleren) i forhold til hvor mye de varierer hver for seg (nevneren). To viktige ting: rr fanger bare lineære sammenhenger -- en sterk bue kan gi r0r \approx 0 -- og rr er enhetsfri, så måleskalaen spiller ingen rolle. Studietid og eksamenspoeng kan gi r0,99r \approx 0{,}99, en svært sterk positiv sammenheng. Men husk: dette beviser ikke at studietid forårsaker gode resultater.

Fra sammenheng til modell

Korrelasjonen forteller bare hvor sterk sammenhengen er. Lineær regresjon gir oss noe mer: en matematisk modell vi kan bruke til å predikere. Modellen er en rett linje, y^=a+bx\hat{y} = a + bx, der y^\hat{y} er den predikerte verdien, aa er konstantleddet (verdien når x=0x = 0), og bb er stigningstallet -- hvor mye y^\hat{y} endrer seg per enhet økning i xx.

Linja finner vi med minste kvadraters metode, som minimerer summen av de kvadrerte avvikene mellom observerte og predikerte verdier. Stigningstallet er b=(xixˉ)(yiyˉ)(xixˉ)2\displaystyle b = \frac{\sum(x_i - \bar{x})(y_i - \bar{y})}{\sum(x_i - \bar{x})^2}, og konstantleddet a=yˉbxˉa = \bar{y} - b\bar{x}. Merk forskjellen mellom rr og bb: korrelasjonen er enhetsfri, mens stigningstallet har enheter (yy-enheter per xx-enhet). For studietid-dataene gir det b=455250=1,82\displaystyle b = \frac{455}{250} = 1{,}82 og a=711,8215=43,7a = 71 - 1{,}82 \cdot 15 = 43{,}7, altså y^=43,7+1,82x\hat{y} = 43{,}7 + 1{,}82x. Vil du predikere poengsummen for noen som studerer 18 timer, setter du inn: y^=43,7+1,821876,5\hat{y} = 43{,}7 + 1{,}82 \cdot 18 \approx 76{,}5 poeng.

Legg merke til hva stigningstallet faktisk betyr: for hver ekstra time studietid stiger predikert poengsum med 1,82. Det er ikke korrelasjonen, og det er ikke skjæringspunktet -- det er endringsraten.

📝Oppgave Quiz 1

Hvor mye forklarer modellen?

Når du har en regresjonsmodell, vil du vite hvor godt den passer. Det forteller determinasjonskoeffisienten R2R^2, som rett og slett er korrelasjonen kvadrert: R2=r2R^2 = r^2. Den angir hvor stor andel av variasjonen i yy som forklares av den lineære sammenhengen med xx. Er r=0,80r = 0{,}80, blir R2=0,64R^2 = 0{,}64 -- altså forklarer modellen 64 % av variasjonen, mens de resterende 36 % skyldes andre faktorer eller tilfeldigheter. For studietid-eksempelet med r=0,988r = 0{,}988 blir R2=0,976R^2 = 0{,}976, hele 97,6 %.

Men selv en knallhøy R2R^2 rommer feller. Den farligste er at korrelasjon ikke er kausalitet. At studietid og poeng henger tett sammen, betyr ikke at studietid forårsaker poengene -- motivasjon, forkunnskaper eller bakgrunn kan drive begge deler. Det klassiske skrekkeksempelet er iskremsalg og drukningsulykker, som kan ha r=0,85r = 0{,}85. Iskrem dreper selvsagt ingen -- den skjulte (konfunderende) variabelen er varmt vær, som både får folk til å kjøpe is og til å bade. Sammenhengen er ekte i tallene, men falsk som årsak.

To andre farer er verdt å merke seg. Ekstrapolering -- å predikere for xx-verdier langt utenfor dataområdet -- er risikabelt, for mønsteret du så innenfor dataene trenger ikke gjelde utenfor. Og uteliggere, enkeltpunkter langt fra resten, kan dra regresjonslinja kraftig i feil retning. Sjekk derfor alltid dataene før du stoler på modellen.

📝Oppgave Quiz 2

Oppsummering

Vi har sett at Pearsons rr måler styrken og retningen av en lineær sammenheng mellom to kvantitative variabler, alltid mellom 1-1 og +1+1 og enhetsfri. Lineær regresjon gir modellen y^=a+bx\hat{y} = a + bx, der stigningstallet bb er endringen i predikert yy per enhet xx, og konstantleddet aa er verdien når x=0x = 0. Determinasjonskoeffisienten R2=r2R^2 = r^2 forteller hvor stor andel av variasjonen modellen forklarer.

De viktigste advarslene er at korrelasjon ikke er kausalitet -- konfunderende variabler som varmt vær kan skape falske sammenhenger -- og at ekstrapolering utenfor dataområdet og uteliggere kan føre deg på villspor. En modell beskriver et mønster i tallene, ikke nødvendigvis en årsak.

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.