Tilbake
5.3

5.3 Regresjon — prediksjon, minste kvadrater og r²

«Regresjon som videreføring av korrelasjon» — resonnementet som har stått i minst ti sett — pluss Ŷ = a + bX ledd for ledd, prediksjon med tall, minste kvadraters metode og r² som delt/forklart varians. Hvert regnestykke ender i prosatolkning.

60 min
4 oppgaver
Regresjonprediksjonminste kvadrater
Din fremgang i kapitlet
0 / 4 oppgaver
Forkunnskaper. Dette kapitlet bygger på kap. 5.1 (korrelasjon: retning, styrke, samvariasjon ≠ kausalitet).

Sist du var her (oppfrisket):

- rr måler styrke og retning på en lineær sammenheng, mellom 1-1 og +1+1.
- rr sier ingenting om hvor mye Y endrer seg per enhet X — bare hvor tett de følger hverandre.
- Korrelasjon er samvariasjon, ikke kausalitet — det gjelder også regresjonen vi bygger her.

Du trenger ingen ny statistikk-formel utover det som oppgis; men her regner vi (i motsetning til 5.1). Ha en enkel kalkulator klar.

Symbol- og formelliste
Hverdagsanker. En korrelasjon forteller deg at studietimer og eksamensskår henger sammen — men ikke hvor mange poeng du kan vente av én ekstra time. Regresjon svarer på nettopp det: den gir en ligning som predikerer Y fra X.

Dette er grunnen til at regresjon kalles «en videreføring av korrelasjon»: samme data, samme sammenheng — men nå med en linje du kan sette tall inn i. Vi tolker linjen i ord, predikerer med tall, og regner delt varians r2r^2. ~60 min.

Løkke 1 — Fra korrelasjon til linje: hva a og b betyr (~15 min)

Regresjon og regresjonsligningen
Regresjon bygger videre på korrelasjonen ved å tilpasse en rett linje til dataene — en linje som lar oss predikere Y fra en gitt X:

Y^=a+bX\hat{Y} = a + bX

- Y^\hat{Y} («Y-hatt») er den predikerte verdien av Y — modellens beste gjett, ikke en observert verdi.
- aa (intercept/konstantledd) er Y^\hat{Y} når X=0X = 0: der linjen krysser Y-aksen.
- bb (regresjonsvekt/stigningstall) er endringen i Y^\hat{Y} per én enhets økning i X. Fortegnet på bb følger fortegnet på rr.

Regresjon gir altså mer enn korrelasjonen: ikke bare at X og Y henger sammen, men hvor mye Y ventes å endre seg. Men den gir fortsatt ikke kausalitet — det er samme naturlige variasjon som i kap. 5.1.

Prediktor og kriterium

I regresjon er variabelrollene ikke vilkårlige (i motsetning til korrelasjon):

- Prediktorvariabel (XX): den vi predikerer fra.
- Kriterievariabel (YY): den vi predikerer.

Bytter du om X og Y i en regresjon, får du en annen linje — fordi Y^=a+bX\hat{Y} = a + bX minimerer feilen i Y, ikke i X. Dette er en viktig kontrast til korrelasjonen, der rr er symmetrisk og rollene er et fritt valg.

> Feilkode #13 (glosset her ved første bruk): «usynlig utregning» — å skrive svaret uten mellomregning. I regnedeler kan sensor da ikke gi «riktig metode»-uttelling. Feilkode #3 (fra kap. 5.2): kausal tolkning av en (korrelasjons)sammenheng — lurer også i regresjon.

✏️Eksempel 1 — tolke a og b i ord

En regresjon av eksamensskår (YY, poeng) på antall studietimer (XX) gir ligningen Y^=20+2,5X\hat{Y} = 20 + 2{,}5X. Tolk aa og bb i ord.

Intercept a=20a = 20: en student som studerer X=0X = 0 timer predikeres til Y^=20\hat{Y} = 20 poeng. Altså modellens gjett for «null timer». Merk: aa er ikke «effekten av X» — det er utgangspunktet når X er null. (Og det gir bare mening hvis X=0X = 0 er innenfor det observerte området.)

Regresjonsvekt b=2,5b = 2{,}5: for hver ekstra studietime øker den predikerte skåren med 2,5 poeng. Det positive fortegnet betyr at sammenhengen er positiv (samsvarer med et positivt rr).

Prosatolkning: modellen sier at studenter som ikke studerer ventes å få 20 poeng, og at hver studietime i snitt henger sammen med 2,5 poeng høyere skår. Dette er en prediksjon, ikke et bevis på at timene forårsaker poengene — det er fortsatt korrelasjonsdata.

Figuren under viser regresjonslinja Y^=20+2,5X\hat{Y} = 20 + 2{,}5X lagt gjennom en punktsky: linja starter ved a=20a = 20 på Y-aksen (X = 0) og stiger med b=2,5b = 2{,}5 poeng per studietime.

📝Oppgave 5.3.1
(Eksamenssjanger T1/T3 — tolke ligningen. Lett innstegsoppgave.)

En regresjon gir Y^=30+1,5X\hat{Y} = 30 + 1{,}5X, der YY er trivselsskår og XX er antall timer fysisk aktivitet per uke.

a) Hva betyr a=30a = 30?
b) Hva betyr b=1,5b = 1{,}5?

Løkke 2 — Prediksjon: sett inn og regn Ŷ (~14 min)

📜Prediksjon med regresjonsligningen
For å predikere Y for en gitt X, sett X-verdien rett inn i ligningen:

Y^=a+bX\hat{Y} = a + bX

1. Skriv opp ligningen med de oppgitte aa og bb.
2. Sett inn X-verdien.
3. Regn ut — vis mellomregningen (a+bXa + b \cdot X).
4. Tolk resultatet i ord, og sjekk om X ligger innenfor det observerte området (ellers ekstrapolerer du — se advarselen under).

✏️Eksempel 2 — regn en prediksjon

Med Y^=20+2,5X\hat{Y} = 20 + 2{,}5X (studietimer → eksamensskår): hva predikeres skåren for en student som studerer X=12X = 12 timer? Og hva er residualen hvis studenten faktisk fikk 52 poeng?

Prediksjon:

Y^=20+2,512=20+30=50 poeng\hat{Y} = 20 + 2{,}5 \cdot 12 = 20 + 30 = 50 \text{ poeng}

Residual: residualen er den faktiske verdien minus den predikerte:

YY^=5250=2 poengY - \hat{Y} = 52 - 50 = 2 \text{ poeng}

Prosatolkning: modellen gjettet 50 poeng for 12 timer; studenten fikk faktisk 52 — altså 2 poeng bedre enn modellen forutsa. Residualen på +2+2 er modellens «bomavstand» for denne personen. Studenter over linjen har positive residualer (gjorde det bedre enn ventet), de under har negative.

📝Oppgave 5.3.2
(Eksamenssjanger T3 — prediksjon + residual, gjenganger.)

En regresjon av søvnkvalitet (YY, skala 0–100) på minutter skjermtid før leggetid (XX) gir Y^=1004X\hat{Y} = 100 - 4X (der XX måles i ti-minutters bolker: X=3X = 3 betyr 30 min).

a) Predikér søvnkvaliteten for X=3X = 3 (30 minutter skjermtid).
b) En person med X=3X = 3 rapporterer faktisk 82. Regn residualen og tolk den.
c) Hva betyr det negative b=4b = -4?

Løkke 3 — r² som delt varians: fra rangering til andel (~16 min)

— naturlig pausepunkt før det faste d-leddet —

r² — delt (forklart) varians
r2r^2 er kvadratet av korrelasjonen og tolkes som andelen av variasjonen i Y som deles med (kan «forklares» av) X:

r2=(r)2r^2 = (r)^2

Et eksempel: r=0,30r2=0,09=9%r = 0{,}30 \Rightarrow r^2 = 0{,}09 = 9\,\%. Det betyr at 9 % av variasjonen i Y henger sammen med X — og de resterende 91 % skyldes andre faktorer (og tilfeldig variasjon).

Hvorfor er dette nyttig? Fordi rr selv bare kan rangeres: r=0,4r = 0{,}4 er sterkere enn r=0,2r = 0{,}2, men ikke «dobbelt så sterk». r2r^2 gir derimot andeler som kan sammenlignes direkte: r=0,4r = 0{,}4 deler r2=0,16=16%r^2 = 0{,}16 = 16\,\%, mens r=0,2r = 0{,}2 deler bare 0,04=4%0{,}04 = 4\,\% — altså fire ganger så mye forklart varians. Det er dette målenivåskiftet (fra rangering til andel) som gjør r2r^2 verdt et eget svarledd.

✏️Eksempel 3 — regn og tolk r²

En studie rapporterer r=0,40r = 0{,}40 mellom motivasjon og prestasjon. Regn r2r^2 og tolk det. Sammenlign så med en annen sammenheng der r=0,20r = 0{,}20.

Regning: r2=(0,40)2=0,16r^2 = (0{,}40)^2 = 0{,}16, altså 16 %.

Prosatolkning: 16 % av variasjonen i prestasjon henger sammen med motivasjon; de resterende 84 % skyldes andre faktorer (evner, undervisning, tilfeldig variasjon m.m.). En «moderat» korrelasjon forklarer altså en ganske beskjeden andel — et nyttig realitetssjekk.

Sammenligning: for r=0,20r = 0{,}20 er r2=(0,20)2=0,04=4%r^2 = (0{,}20)^2 = 0{,}04 = 4\,\%. Selv om r=0,40r = 0{,}40 tallmessig bare er dobbelt så stor som 0,200{,}20, forklarer den fire ganger så mye varians (16%16\,\% mot 4%4\,\%). Det er nettopp poenget: rr kan ikke ganges/sammenlignes lineært — men r2r^2 kan.

📝Oppgave 5.3.3
(Eksamenssjanger T1/T3 — r² som delt varians, fast d-ledd.)

En studie finner r=0,50r = 0{,}50 mellom en ny konsentrasjonstest og karaktersnitt.

a) Regn r2r^2 og tolk det i prosa.
b) En kollega sier: «r=0,50r = 0{,}50, så testen forklarer halvparten av karakterene.» Hva er feil?
c) Hvor mye mer forklart varians gir r=0,50r = 0{,}50 enn r=0,25r = 0{,}25?

Løkke 4 — Minste kvadrater og regresjonslinjen i diagrammet (~13 min)

Minste kvadraters metode

Hvordan velges den linjen blant alle mulige? Ved minste kvadraters metode: man velger aa og bb slik at summen av de kvadrerte residualene (de kvadrerte avstandene YY^Y - \hat{Y} fra hvert punkt ned til linjen) blir minst mulig.

Konseptuelt: linjen legges der den samlet ligger nærmest alle punktene, med ekstra straff for store bom (fordi avstandene kvadreres). Du regner aldri dette for hånd på eksamen — men du skal kunne forklare hva linjen minimerer: de kvadrerte prediksjonsfeilene.

Residual — modellens ærlighet

En residual er avstanden fra en faktisk observert verdi til linjen: YY^Y - \hat{Y}. Den forteller hvor mye modellen bommet for den enkelte personen.

Figuren under viser dette: noen punkter ligger over linja, andre under.

- Positiv residual: punktet ligger over linjen (skåren var høyere enn predikert).
- Negativ residual: punktet ligger under linjen.

Residualene er modellens ærlighet: store residualer betyr at linjen forklarer lite (lav r2r^2), små residualer betyr god tilpasning (høy r2r^2). Minste kvadrater gjør nettopp den samlede kvadrerte residualsummen minst mulig.

Å skissere regresjonslinjen

I et spredningsdiagram (hvert punkt = én person, med X vannrett og Y loddrett) er regresjonslinjen den rette linjen som best følger punktskyen:

- Den krysser Y-aksen i aa (der X=0X = 0).
- Den stiger med bb (opp hvis b>0b > 0, ned hvis b<0b < 0).
- Punktene sprer seg rundt linjen; jo tettere de ligger, jo høyere r2r^2.

Å plassere to punkter fra ligningen (f.eks. Y^\hat{Y} ved en lav og en høy X) og trekke linjen mellom dem er nok til en skisse. En sky uten tydelig stigning (r0r \approx 0) gir en nesten flat linje.

📝Oppgave 5.3.4
(Eksamenssjanger T1/T3 — hele regresjonspakken på eksamensnivå. (krevende).)

En studie av 60 studenter gir regresjonen Y^=40+2X\hat{Y} = 40 + 2X, der YY er eksamensskår (poeng) og XX er antall gjennomførte øvingsoppgaver (observert område: 0–20 oppgaver). Korrelasjonen er r=0,60r = 0{,}60.

a) Tolk aa og bb i ord.
b) Predikér skåren for en student med X=15X = 15 oppgaver, og for én med X=40X = 40. Kommentér den siste.
c) Regn r2r^2 og tolk det.
d) Forklar med denne oppgaven hvorfor «regresjon er en videreføring av korrelasjon» er en presis beskrivelse — og hva regresjonen ikke legger til.

Begrepsbank — regresjon

Flashcard-/repetisjonsstoff — hopp trygt over ved førstegangslesing; tidsanslaget over gjelder kjernestoffet.

Predikert verdi Ŷ

«Y-hatt»: modellens beste gjett for Y gitt en X, lest av regresjonslinjen. Til forskjell fra YY (den faktisk observerte verdien). Regnes ved å sette X inn i Y^=a+bX\hat{Y} = a + bX.

Intercept a

Konstantleddet: Y^\hat{Y} når X=0X = 0 — der linjen krysser Y-aksen. Utgangspunktet, ikke «effekten av X». Gir bare mening hvis X=0X = 0 er innenfor det observerte området.

Regresjonsvekt b

Stigningstallet: endringen i predikert Y per én enhets økning i X. Fortegnet følger rr (positivt rr → positiv bb). Dette er «hvor mye», som korrelasjonen alene ikke gir.

Regresjonsligningen
Y^=a+bX\hat{Y} = a + bX: linjen som predikerer kriteriet Y fra prediktoren X. Videreføring av korrelasjonen — samme sammenheng, nå som prediksjonsverktøy. Gir ikke kausalitet.
Prediktorvariabel (X)

Variabelen vi predikerer fra i en regresjon. Til forskjell fra korrelasjon er X/Y-rollene her ikke vilkårlige: bytter du prediktor og kriterium, får du en annen linje.

Kriterievariabel (Y)

Variabelen vi predikerer til i en regresjon. Minste kvadraters metode minimerer feilen i Y (ikke i X) — derfor er regresjonen asymmetrisk.

r² (delt/forklart varians)

Kvadratet av korrelasjonen: andelen av variasjonen i Y som deles med X. r=0,30r2=0,09=9%r = 0{,}30 \Rightarrow r^2 = 0{,}09 = 9\,\%; resten skyldes andre faktorer. Gir andeler som kan sammenlignes.

r kan rangeres, r² sammenlignes
rr sier bare at 0,4 er sterkere enn 0,2 (ikke «dobbelt»). r2r^2 gir andeler: 0,160{,}16 vs. 0,040{,}04 — fire ganger så mye forklart varians. Målenivåskiftet som gjør r2r^2 verdt et eget svarledd.
Minste kvadraters metode

Linjen velges så summen av kvadrerte residualer (YY^Y - \hat{Y}) blir minst mulig — nærmest alle punkter, med ekstra straff for store bom. Regnes aldri for hånd; skal kunne forklares.

Residual (Y − Ŷ)

Avstanden fra en faktisk verdi til linjen: hvor mye modellen bommet for den personen. Positiv = over linjen, negativ = under. Store residualer = lav r2r^2; små = god tilpasning.

Ekstrapolering

Å predikere for X-verdier utenfor det observerte området. Upålitelig — linjen «kjenner» ikke terrenget der ute, og sammenhengen kan bryte sammen. Oppgi forbeholdet.

Spredningsdiagram

Figuren regresjonslinjen tegnes i: hvert punkt = én person (X vannrett, Y loddrett). Linjen krysser Y-aksen i aa og stiger med bb; tett punktsky = høy r2r^2.

«Regresjon som videreføring av korrelasjon»

Det ferdig innøvde resonnementet (10+ sett): regresjon bruker samme sammenheng som rr, men legger til en prediksjonslinje (hvor mye Y endrer seg per X). Den legger ikke til kausalitet.

Repetisjon — pensumkart for 5.3

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.

Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Universitetet i Oslo. Dette er ikke offisielt studiemateriell. Innholdet er læringsstoff, ikke helse- eller medisinske råd. Les mer.