Tilbake
2.5
Korrelasjon og regresjon

2.5 Korrelasjon og regresjon

Korrelasjon, regresjonsanalyse og bestemmelseskoeffisient.

35 min
5 oppgaver
KorrelasjonRegresjonR-kvadrat
Du leser den tradisjonelle versjonen
Din fremgang i kapitlet
0 / 5 oppgaver

Korrelasjon og regresjon

Så langt har vi sett på hvordan vi beskriver én variabel om gangen – med gjennomsnitt, standardavvik og diagrammer. Men i forskning og dataanalyse er vi ofte interessert i sammenhengen mellom to variabler. Er det en sammenheng mellom antall timer man leser og resultatet på en prøve? Henger temperatur og issalg sammen?

I dette kapittelet lærer du å måle og beskrive slike sammenhenger ved hjelp av korrelasjon og regresjon.

Korrelasjon
Korrelasjon er et statistisk mål på styrken og retningen av den lineære sammenhengen mellom to variabler. Korrelasjonskoeffisienten rr (Pearsons rr) ligger alltid mellom 1-1 og 11.

Tolkning av rr:
- r=1r = 1: Perfekt positiv korrelasjon – når den ene variabelen øker, øker den andre proporsjonalt
- r=1r = -1: Perfekt negativ korrelasjon – når den ene øker, synker den andre proporsjonalt
- r=0r = 0: Ingen lineær korrelasjon – ingen lineær sammenheng

Tommelfingerregel for styrke:

r|r|Styrke
0,0–0,3Svak korrelasjon
0,3–0,7Moderat korrelasjon
0,7–1,0Sterk korrelasjon

Viktig: Korrelasjon betyr ikke årsakssammenheng. At to variabler korrelerer, betyr ikke at den ene forårsaker den andre.
✏️Eksempel: Tolke korrelasjon

En forsker undersøker sammenhengen mellom antall timer studietid per uke og poeng på en eksamen for 8 studenter. Hun beregner r=0,82r = 0{,}82. Hva forteller dette oss?

Tolkning av r=0,82r = 0{,}82:

1. Retning: rr er positiv, så sammenhengen er positiv – mer studietid henger sammen med høyere poeng.

2. Styrke: r=0,82>0,7|r| = 0{,}82 > 0{,}7, så korrelasjonen er sterk. Det er en tydelig lineær sammenheng.

3. Hva vi IKKE kan si: Vi kan ikke konkludere med at mer studietid forårsaker bedre resultater. Det kan finnes andre faktorer (f.eks. motivasjon, forkunnskaper) som påvirker begge variablene. Men sammenhengen er tydelig og i forventet retning.

📝Oppgave 1

En studie viser at korrelasjonen mellom iskremforbruk og antall drukningsulykker per måned er r=0,87r = 0{,}87. Hva er den beste tolkningen?

Lineær regresjon
Lineær regresjon er en metode for å finne den rette linjen som best beskriver sammenhengen mellom to variabler. Linjen kalles regresjonslinjen og skrives:

y^=ax+b\hat{y} = ax + b

der:
- y^\hat{y} er den predikerte verdien av yy
- aa er stigningstallet – hvor mye yy endres når xx øker med 1
- bb er konstantleddet – verdien av y^\hat{y} når x=0x = 0
- xx er den forklarende variabelen (uavhengig variabel)

Regresjonslinjen bestemmes ved minste kvadraters metode – den linjen som minimerer summen av de kvadrerte avstandene mellom de faktiske punktene og linjen.

✏️Eksempel: Tolke en regresjonslinje

En regresjonsanalyse av sammenhengen mellom studietid (timer/uke) og eksamenspoeng (av 100) gir ligningen y^=3,5x+42\hat{y} = 3{,}5x + 42. Tolk stigningstallet og konstantleddet, og prediker poengsummen for en student som studerer 12 timer per uke.

Tolkning:
- Stigningstall a=3,5a = 3{,}5: For hver ekstra time studietid per uke, øker forventet poengsum med 3,5 poeng.
- Konstantledd b=42b = 42: En student som studerer 0 timer per uke, forventes å få 42 poeng. (Merk: dette er en matematisk ekstrapolering – i praksis studerer alle noe.)

Prediksjon for x=12x = 12 timer:
y^=3,512+42=42+42=84 poeng\hat{y} = 3{,}5 \cdot 12 + 42 = 42 + 42 = 84 \text{ poeng}

En student som studerer 12 timer per uke, kan forventes å oppnå ca. 84 poeng på eksamen ifølge modellen.

Advarsel: Modellen er bare gyldig innenfor det dataområdet den er basert på. Å bruke den for x=30x = 30 timer ville gi y^=147\hat{y} = 147 poeng, noe som er umulig med maks 100 poeng. Slik ekstrapolering er upålitelig.

📝Oppgave 2

Regresjonslinjen for sammenhengen mellom alder (år) og lungekapasitet (liter) hos barn er y^=0,25x+0,5\hat{y} = 0{,}25x + 0{,}5. Hva betyr stigningstallet?

Bestemmelseskoeffisienten R²
Bestemmelseskoeffisienten R2R^2 angir hvor stor andel av variasjonen i den avhengige variabelen (yy) som forklares av regresjonsmodellen. R2R^2 er kvadratet av korrelasjonskoeffisienten: R2=r2R^2 = r^2.

- R2=1R^2 = 1 (100 %): Modellen forklarer all variasjon – alle punkter ligger nøyaktig på linjen.
- R2=0R^2 = 0 (0 %): Modellen forklarer ingen variasjon – xx og yy har ingen lineær sammenheng.

Eksempel: Hvis r=0,82r = 0{,}82, er R2=0,822=0,67R^2 = 0{,}82^2 = 0{,}67. Det betyr at modellen forklarer 67 % av variasjonen i yy. De resterende 33 % skyldes andre faktorer eller tilfeldig variasjon.

Tommelfingerregel:
- R2>0,7R^2 > 0{,}7: God modell
- R2=0,40,7R^2 = 0{,}4\text{–}0{,}7: Moderat modell
- R2<0,4R^2 < 0{,}4: Svak modell – andre faktorer spiller stor rolle

✏️Eksempel: Vurdere modellens kvalitet

En forsker undersøker sammenhengen mellom daglig skjermtid (timer) og søvnkvalitet (skala 1–10). Regresjonsanalysen gir y^=0,6x+8,2\hat{y} = -0{,}6x + 8{,}2 med R2=0,45R^2 = 0{,}45. Tolk resultatene.

Regresjonslinje: y^=0,6x+8,2\hat{y} = -0{,}6x + 8{,}2
- Stigningstall a=0,6a = -0{,}6: For hver ekstra time skjermtid synker søvnkvaliteten med 0,6 poeng. Sammenhengen er negativ.
- Konstantledd b=8,2b = 8{,}2: Uten skjermtid er forventet søvnkvalitet 8,2 av 10.

R2=0,45R^2 = 0{,}45: Modellen forklarer 45 % av variasjonen i søvnkvalitet. Det betyr at skjermtid bidrar til å forklare nesten halvparten av forskjellene i søvnkvalitet.

De resterende 55 % skyldes andre faktorer som modellen ikke fanger opp, for eksempel stress, fysisk aktivitet, koffeininntak, soveromsmiljø, søvnvaner med mer.

Vurdering: Modellen er moderat (R2R^2 mellom 0,4 og 0,7). Skjermtid er en relevant faktor, men langt fra den eneste forklaringen på søvnkvalitet.

📝Oppgave 3

En regresjonsmodell har R2=0,81R^2 = 0{,}81. Hva betyr dette?

Oppsummering

- Korrelasjon (rr) måler styrken og retningen av lineær sammenheng mellom to variabler. Verdien ligger mellom 1-1 og 11.
- Korrelasjon betyr ikke årsakssammenheng – bakenforliggende variabler kan forklare tilsynelatende sammenhenger.
- Lineær regresjon finner den rette linjen (y^=ax+b\hat{y} = ax + b) som best beskriver sammenhengen.
- Stigningstallet aa forteller hvor mye yy endres når xx øker med 1.
- R2R^2 (bestemmelseskoeffisienten) angir hvor stor andel av variasjonen i yy som forklares av modellen.
- Vær forsiktig med ekstrapolering – å bruke modellen utenfor dataområdet den er basert på er upålitelig.

📝Oppgave 4

En forsker måler sammenhengen mellom gjødslingsmengde (kg per dekar) og avlingsmengde (tonn per dekar) for åtte gårder. Regresjonsanalysen gir y^=0,08x+2,1\hat{y} = 0{,}08x + 2{,}1 med r=0,76r = 0{,}76.

a) Tolk stigningstallet og konstantleddet.
b) Beregn R2R^2 og vurder modellens kvalitet.
c) Prediker avlingsmengden for en gård som bruker 50 kg gjødsel per dekar.

📝Oppgave 5

Du leser en avisartikkel med overskriften «Studien beviser: Mer sjokolade gir bedre karakterer!» Artikkelen refererer til en studie som viser en positiv korrelasjon (r=0,45r = 0{,}45) mellom sjokoladeforbruk og skoleresultater.

a) Hva er problematisk med avisoverskriften?
b) Foreslå minst to bakenforliggende variabler som kan forklare sammenhengen.
c) Hvordan ville du designet en studie for å teste om sjokolade faktisk påvirker skoleprestasjoner?

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.