Tilbake
2.4
Korrelasjon og regresjon

2.4 Korrelasjon og regresjon

Pearsons r, lineær regresjon, R² og prediksjon.

30 min
5 oppgaver
KorrelasjonRegresjonPrediksjon
Du leser den tradisjonelle versjonen
Din fremgang i kapitlet
0 / 5 oppgaver

Korrelasjon og regresjon

Mens t-tester og kjikvadratstester sammenligner grupper, handler korrelasjon og regresjon om å undersøke sammenhengen mellom to kvantitative variabler. Er det en sammenheng mellom studietid og eksamensresultat? Mellom temperatur og energiforbruk? Mellom alder og reaksjonstid?

Læringsmål:
- Beregne og tolke Pearsons korrelasjonskoeffisient rr
- Forstå forskjellen mellom korrelasjon og kausalitet
- Utføre enkel lineær regresjon og tolke regresjonsligningen
- Forklare og tolke forklaringsgraden R2R^2
- Bruke regresjonsmodellen til prediksjon og forstå begrensningene

Pearsons korrelasjonskoeffisient rr

Pearsons korrelasjonskoeffisient rr er et mål på styrken og retningen av den lineære sammenhengen mellom to kvantitative variabler.

Verdien av rr ligger alltid mellom 1-1 og +1+1:
- r=+1r = +1: Perfekt positiv lineær sammenheng (begge variablene øker sammen)
- r=0r = 0: Ingen lineær sammenheng
- r=1r = -1: Perfekt negativ lineær sammenheng (den ene øker mens den andre synker)

Tolkning av styrke

r|r|Styrke
0,00 – 0,19Svak eller ingen
0,20 – 0,39Svak
0,40 – 0,59Moderat
0,60 – 0,79Sterk
0,80 – 1,00Svært sterk

Beregning


Pearsons rr beregnes med formelen:
r=i=1n(xixˉ)(yiyˉ)i=1n(xixˉ)2i=1n(yiyˉ)2r = \frac{\sum_{i=1}^{n}(x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum_{i=1}^{n}(x_i - \bar{x})^2 \cdot \sum_{i=1}^{n}(y_i - \bar{y})^2}}
Formelen måler i hvilken grad xx og yy varierer sammen (teller) i forhold til hvor mye de varierer hver for seg (nevner).
Pearsons korrelasjonskoeffisient
Pearsons korrelasjonskoeffisient rr måler graden av lineær sammenheng mellom to kvantitative variabler XX og YY.

r=(xixˉ)(yiyˉ)(xixˉ)2(yiyˉ)2r = \frac{\sum(x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum(x_i - \bar{x})^2 \cdot \sum(y_i - \bar{y})^2}}

Egenskaper:
- 1r1-1 \leq r \leq 1
- r>0r > 0: positiv sammenheng (begge øker)
- r<0r < 0: negativ sammenheng (en øker, den andre synker)
- rr måler bare lineær sammenheng — en sterk kurvilineær sammenheng kan gi r0r \approx 0
- rr er enhetsfri — den påvirkes ikke av måleskala

✏️Eksempel: Beregne og tolke Pearsons r

Fem elever har følgende studietid (timer/uke) og eksamenspoeng:

ElevStudietid xxPoeng yy
1550
21065
31572
42080
52588

Beregn rr og tolk resultatet.

Steg 1: Beregn gjennomsnitt
xˉ=(5+10+15+20+25)/5=15\bar{x} = (5+10+15+20+25)/5 = 15
yˉ=(50+65+72+80+88)/5=71\bar{y} = (50+65+72+80+88)/5 = 71

Steg 2: Beregn avviksprodukter og kvadrater

Elevxixˉx_i - \bar{x}yiyˉy_i - \bar{y}(xixˉ)(yiyˉ)(x_i-\bar{x})(y_i-\bar{y})(xixˉ)2(x_i-\bar{x})^2(yiyˉ)2(y_i-\bar{y})^2
110-1021-21210210100100441441
25-56-6303025253636
30011000011
45599454525258181
510101717170170100100289289
Sum455250848

Steg 3: Beregn rr
r=455250848=455212000=455460,40,988r = \frac{455}{\sqrt{250 \cdot 848}} = \frac{455}{\sqrt{212000}} = \frac{455}{460{,}4} \approx 0{,}988
Tolkning: r=0,99r = 0{,}99 indikerer en svært sterk positiv lineær sammenheng mellom studietid og eksamenspoeng. Elever som studerer mer, får konsistent høyere poeng. Men husk: korrelasjon beviser ikke kausalitet — det kan finnes konfunderende variabler.
📝Oppgave 2.4.1

En studie finner r=0,72r = -0{,}72 mellom antall timer skjermtid og antall timer søvn per natt. Hva betyr dette?

Lineær regresjon

Mens korrelasjon bare måler styrken av sammenhengen, gir lineær regresjon oss en matematisk modell for sammenhengen. Den gir oss en ligning vi kan bruke til å predikere verdien av yy basert på verdien av xx.

Den lineære regresjonsmodellen er:

y^=a+bx\hat{y} = a + bx

der:
- y^\hat{y} er den predikerte verdien av yy
- aa er konstantleddet (skjæringspunkt med yy-aksen) — verdien av y^\hat{y} når x=0x = 0
- bb er stigningstallet (regresjonskoeffisienten) — hvor mye y^\hat{y} endrer seg per enhet økning i xx

Minste kvadraters metode

Regresjonslinjen beregnes ved å minimere summen av kvadrerte avvik mellom observerte og predikerte verdier (residualene). Stigningstallet er:

b=(xixˉ)(yiyˉ)(xixˉ)2=rsysxb = \frac{\sum(x_i - \bar{x})(y_i - \bar{y})}{\sum(x_i - \bar{x})^2} = r \cdot \frac{s_y}{s_x}

Konstantleddet er:

a=yˉbxˉa = \bar{y} - b\bar{x}

Legg merke til sammenhengen: stigningstallet bb er knyttet til korrelasjonskoeffisienten rr, men skalert med forholdet mellom standardavvikene. Mens rr er enhetsfri, har bb enheter (yy-enheter per xx-enhet).

Lineær regresjon
Enkel lineær regresjon modellerer sammenhengen mellom en uavhengig variabel xx og en avhengig variabel yy med en rett linje:

y^=a+bx\hat{y} = a + bx

Stigningstall: b=(xixˉ)(yiyˉ)(xixˉ)2\displaystyle b = \frac{\sum(x_i - \bar{x})(y_i - \bar{y})}{\sum(x_i - \bar{x})^2}

Konstantledd: a=yˉbxˉa = \bar{y} - b\bar{x}

Residual: ei=yiy^ie_i = y_i - \hat{y}_i (avviket mellom observert og predikert verdi)

Regresjonslinjen går alltid gjennom punktet (xˉ,yˉ)(\bar{x}, \bar{y}) og minimerer summen av kvadrerte residualer ei2\sum e_i^2.

✏️Eksempel: Lineær regresjon

Bruk dataene fra forrige eksempel (studietid og poeng) til å finne regresjonslinjen, og prediker poengsummen for en elev som studerer 18 timer per uke.

Fra forrige eksempel har vi: xˉ=15\bar{x} = 15, yˉ=71\bar{y} = 71, (xixˉ)(yiyˉ)=455\sum(x_i - \bar{x})(y_i - \bar{y}) = 455 og (xixˉ)2=250\sum(x_i - \bar{x})^2 = 250.

Steg 1: Beregn stigningstallet

b=455250=1,82b = \frac{455}{250} = 1{,}82

For hver time ekstra studietid per uke øker predikert poengsum med 1,82 poeng.

Steg 2: Beregn konstantleddet

a=711,8215=7127,3=43,7a = 71 - 1{,}82 \cdot 15 = 71 - 27{,}3 = 43{,}7

Steg 3: Regresjonslinjen

y^=43,7+1,82x\hat{y} = 43{,}7 + 1{,}82x

Steg 4: Prediksjon for x=18x = 18

y^=43,7+1,8218=43,7+32,76=76,5 poeng\hat{y} = 43{,}7 + 1{,}82 \cdot 18 = 43{,}7 + 32{,}76 = 76{,}5 \text{ poeng}

En elev som studerer 18 timer per uke predikeres å få ca. 76,5 poeng. Men dette er bare en prediksjon — den faktiske poengsummen vil avvike noe fra dette.

📝Oppgave 2.4.2

En regresjonsligning er y^=20+3,5x\hat{y} = 20 + 3{,}5x. Hva er den beste tolkningen av stigningstallet b=3,5b = 3{,}5?

Forklaringsgrad R2R^2 og prediksjon

Determinasjonskoeffisienten R2R^2 angir hvor stor andel av variasjonen i yy som forklares av den lineære sammenhengen med xx. Den beregnes enkelt som:

R2=r2R^2 = r^2

For eksempel: dersom r=0,80r = 0{,}80, er R2=0,64=64%R^2 = 0{,}64 = 64\%. Det betyr at 64 % av variasjonen i yy kan forklares av variasjonen i xx gjennom den lineære modellen. De resterende 36 % skyldes andre faktorer eller tilfeldig variasjon.

Tolkning av R2R^2

- R2=0R^2 = 0: Modellen forklarer ingenting — xx gir ingen informasjon om yy
- R2=1R^2 = 1: Modellen forklarer alt — alle punkter ligger nøyaktig på regresjonslinjen
- I praksis: R2>0,70R^2 > 0{,}70 regnes ofte som god forklaringsgrad i samfunnsvitenskap, mens naturvitenskap ofte krever høyere

Begrensninger ved prediksjon

Ekstrapolering: Å predikere yy for xx-verdier utenfor det observerte dataområdet er risikabelt. Sammenhengen vi observerer innenfor dataområdet trenger ikke gjelde utenfor.

Korrelasjon \neq kausalitet: En regresjonsmodell beskriver en statistisk sammenheng. Den sier ikke at endringer i xx forårsaker endringer i yy. Konfunderende variabler kan forklare hele sammenhengen.

Innflytelsesrike observasjoner: Enkeltpunkter langt fra de andre (uteliggere) kan ha uforholdsmessig stor innflytelse på regresjonslinjen. Det er viktig å sjekke for slike punkter.

Determinasjonskoeffisienten R²
Determinasjonskoeffisienten R2R^2 angir andelen av den totale variasjonen i yy som forklares av regresjonsmodellen.

R2=r2=1SSresSStotR^2 = r^2 = 1 - \frac{SS_{\text{res}}}{SS_{\text{tot}}}

der:
- SSres=(yiy^i)2SS_{\text{res}} = \sum(y_i - \hat{y}_i)^2 er residualvariasjonen (uforklart variasjon)
- SStot=(yiyˉ)2SS_{\text{tot}} = \sum(y_i - \bar{y})^2 er totalvariasjonen

R2R^2 ligger alltid mellom 0 og 1 (0 % og 100 %). En høy R2R^2 betyr at modellen passer godt til dataene, men garanterer ikke at modellen er riktig eller kausal.

✏️Eksempel: R² og modellvurdering

For studietid-eksempelet fant vi r=0,988r = 0{,}988. (a) Beregn R2R^2 og tolk verdien. (b) Drøft om vi kan konkludere med at mer studietid forårsaker bedre eksamensresultater.

(a) R2=r2=0,9882=0,976=97,6%R^2 = r^2 = 0{,}988^2 = 0{,}976 = 97{,}6\%

Tolkning: 97,6 % av variasjonen i eksamenspoeng kan forklares av variasjonen i studietid gjennom den lineære modellen. Bare 2,4 % skyldes andre faktorer. Dette er en svært høy forklaringsgrad.

(b) Selv med R2=97,6%R^2 = 97{,}6\% kan vi ikke konkludere med kausalitet basert på korrelasjon/regresjon alene. Mulige konfunderende variabler:

- Motivasjon: Motiverte elever studerer mer og gjør det bedre på eksamen — men det er motivasjonen som driver begge deler.
- Forkunnskaper: Elever med gode forkunnskaper trenger kanskje mindre studietid for å gjøre det bra, men velger likevel å studere mye fordi de liker faget.
- Sosioøkonomisk bakgrunn: Kan påvirke både studievaner og prestasjoner.

For å påvise kausalitet trenger vi et eksperiment der studietid randomiseres — noe som er vanskelig i praksis. Regresjonsmodellen viser en sterk sammenheng, men ikke en årsakssammenheng.

📝Oppgave 2.4.3

En forsker finner r=0,60r = 0{,}60 mellom antall treningsøkter per uke og VO2-maks. Hva er R2R^2, og hva betyr det?

Oppsummering

- Pearsons rr måler styrken og retningen av lineær sammenheng mellom to kvantitative variabler (1r1-1 \leq r \leq 1).
- Lineær regresjon gir oss modellen y^=a+bx\hat{y} = a + bx der bb er endringen i y^\hat{y} per enhet xx og aa er yy-verdien når x=0x = 0.
- R2=r2R^2 = r^2 angir andelen av variasjonen i yy som forklares av den lineære sammenhengen med xx.
- Stigningstallet beregnes som b=(xixˉ)(yiyˉ)(xixˉ)2\displaystyle b = \frac{\sum(x_i - \bar{x})(y_i - \bar{y})}{\sum(x_i - \bar{x})^2} og konstantleddet som a=yˉbxˉa = \bar{y} - b\bar{x}.
- Korrelasjon beviser ikke kausalitet — konfunderende variabler kan forklare en observert sammenheng.
- Ekstrapolering (prediksjon utenfor dataområdet) er risikabelt og bør unngås.
- Sjekk alltid for uteliggere og vurder om forutsetningene for lineær regresjon er oppfylt.

📝Oppgave 4

En forsker samler inn data om temperatur (xx, i °C) og strømforbruk (yy, i kWh) for 6 vinterdager:

Temperatur10-105-5005510101515
Strømforbruk484235302218

(a) Beregn Pearsons rr og tolk verdien. (b) Finn regresjonslinjen y^=a+bx\hat{y} = a + bx. (c) Prediker strømforbruket ved 3-3 °C. (d) Ville det vært fornuftig å bruke modellen til å predikere strømforbruket ved 3535 °C? Begrunn.

📝Oppgave 5

En avisartikkel skriver: «Forskning viser sterk sammenheng mellom iskremsalg og drukningsulykker (r=0,85r = 0{,}85, R2=0,72R^2 = 0{,}72). Jo mer iskrem som selges, desto flere drukner.» (a) Tolk rr og R2R^2 med korrekte statistiske begreper. (b) Forklar hvorfor det er feil å konkludere med at iskrem forårsaker drukning. (c) Hva er den sannsynlige konfunderende variabelen? (d) Foreslå et forskningsdesign som kunne teste kausalitet.

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.