Tilbake
7.1
Lineær regresjon

7.1 Lineær regresjon

Spredningsplott, minste kvadraters metode, regresjonslinje, residualer og determinasjonskoeffisienten R².

55 min
19 oppgaver
RegresjonslinjenMinste kvadraters metodeResidualer
Du leser den lesevennlige versjonen
Din fremgang i kapitlet
0 / 19 oppgaver

Lønner det seg å lese mer?

En klasse vil teste en gammel påstand: hjelper det egentlig å studere flere timer før prøven? Seks elever noterer studietimene sine og poengsummen de fikk, og dataparene (xi,yi)(x_i, y_i) plottes i et koordinatsystem. Resultatet kalles et spredningsplott (punktdiagram), og det er alltid det første steget når vi undersøker en sammenheng mellom to variabler.

I plottet er xx — studietimene — forklaringsvariabelen (uavhengig variabel), og yy — poengsummen — responsvariabelen (avhengig variabel). Fra plottet vurderer vi fire ting: retningen (positiv, negativ eller ingen sammenheng), formen (lineær eller krummet), styrken (hvor tett punktene følger et mønster) og uteliggere (punkter som skiller seg markant fra resten).

Klassens plott viser punkter som stiger pent mot høyre — flere timer ser ut til å gi flere poeng, og mønsteret virker lineært. Da melder neste spørsmål seg: hvilken rett linje beskriver dataene best? Vi kunne lagt en linjal på øyemål, men to elever ville lagt den forskjellig. Vi trenger en objektiv definisjon av «best».

Ideen er å se på avstandene mellom de observerte yy-verdiene og linjens verdier — de såkalte residualene — og velge linjen som gjør de kvadrerte avstandene minst mulig til sammen. Metoden kalles minste kvadraters metode, og linjen den peker ut, kalles regresjonslinjen. Den er kursens viktigste verktøy for å trekke kunnskap ut av ekte datasett — og resten av kapittelet handler om å finne den, bruke den og bedømme den.

📝Oppgave Quiz 1

Minste kvadraters metode i praksis

Regresjonslinjen er den linjen y^=ax+b\hat{y} = ax + b som minimerer summen av kvadrerte residualer:

S=i=1n(yiy^i)2=i=1n(yiaxib)2S = \sum_{i=1}^{n}(y_i - \hat{y}_i)^2 = \sum_{i=1}^{n}(y_i - ax_i - b)^2

Minste kvadraters metode gir eksplisitte formler for koeffisientene:

a=nxiyixiyinxi2(xi)2b=yˉaxˉa = \frac{n\sum x_i y_i - \sum x_i \sum y_i}{n\sum x_i^2 - (\sum x_i)^2} \qquad b = \bar{y} - a\bar{x}

der xˉ\bar{x} og yˉ\bar{y} er gjennomsnittene. En elegant konsekvens av den siste formelen: regresjonslinjen går alltid gjennom punktet (xˉ,yˉ)(\bar{x}, \bar{y}) — tyngdepunktet i datasettet. I praksis lar vi kalkulator eller regneark gjøre regningen, men det er verdt å se den én gang for hånd.

Klassens seks datapunkter gir n=6n = 6, xi=34\sum x_i = 34, yi=400\sum y_i = 400, xi2=238\sum x_i^2 = 238 og xiyi=2511\sum x_i y_i = 2511. Da blir

a=62511344006238342=14662725,39a = \frac{6 \cdot 2511 - 34 \cdot 400}{6 \cdot 238 - 34^2} = \frac{1466}{272} \approx 5{,}39

og b=66,675,395,6736,12b = 66{,}67 - 5{,}39 \cdot 5{,}67 \approx 36{,}12. Regresjonslinjen er altså

y^=5,39x+36,12\hat{y} = 5{,}39x + 36{,}12

Og nå kommer det viktigste: tolkningen. Stigningstallet betyr at hver ekstra studietime i gjennomsnitt gir cirka 5,4 poeng mer. Konstantleddet betyr at en elev som ikke studerer i det hele tatt, kan forvente rundt 36 poeng. Linjen kan også brukes til prediksjon — hva kan en elev som leser 7 timer forvente? y^=5,397+36,1273,8\hat{y} = 5{,}39 \cdot 7 + 36{,}12 \approx 73{,}8 poeng. Regresjonslinjen forvandler seks løse observasjoner til et verktøy.

📝Oppgave Quiz 2

Residualer og R2R^2 — hvor god er linjen?

Linjen er funnet, men hvor godt passer den egentlig? Første verktøy er residualene. Residualet for datapunkt ii er

ei=yiy^ie_i = y_i - \hat{y}_i

— differansen mellom observert og predikert verdi. Er ei>0e_i > 0, ligger punktet over linjen; er ei<0e_i < 0, ligger det under; og for regresjonslinjen er alltid ei=0\sum e_i = 0 — overskudd og underskudd utligner hverandre. Plotter vi residualene mot xx (et residualplott), bør en god lineær modell vise tilfeldig spredning uten mønster.

For klassens data blir residualene 1,90-1{,}90; 2,712{,}71; 3,07-3{,}07; 3,543{,}54; 1,24-1{,}24; 0,02-0{,}02 — små, uten system, og med sum tilnærmet null. Lovende.

Andre verktøy er determinasjonskoeffisienten R2R^2:

R2=1SSresSStot=1(yiy^i)2(yiyˉ)2R^2 = 1 - \frac{\text{SS}_{\text{res}}}{\text{SS}_{\text{tot}}} = 1 - \frac{\sum(y_i - \hat{y}_i)^2}{\sum(y_i - \bar{y})^2}

Her er SSres\text{SS}_{\text{res}} den uforklarte variasjonen (residualkvadratsummen) og SStot\text{SS}_{\text{tot}} den totale variasjonen i yy. Dermed angir R2R^2 andelen av variasjonen i yy som modellen forklarer. Den ligger alltid mellom 0 og 1: R2=1R^2 = 1 betyr at alle punktene ligger eksakt på linjen, R2=0R^2 = 0 at modellen ikke forklarer noe, og R2=0,85R^2 = 0{,}85 at 85 % av variasjonen i yy forklares av xx.

For studiedataene: SSres32,4\text{SS}_{\text{res}} \approx 32{,}4 og SStot1333,3\text{SS}_{\text{tot}} \approx 1333{,}3 gir

R2=132,41333,30,976R^2 = 1 - \frac{32{,}4}{1333{,}3} \approx 0{,}976

Studietimene forklarer altså cirka 97,6 % av variasjonen i poengsum — en svært god tilpasning. Klassen har sitt svar: ja, det lønner seg å lese. Men husk allerede nå: en høy R2R^2 er ikke hele historien — det skal kapittel 7.4 vise.

📝Oppgave Quiz 3

Oppsummering: linjen gjennom datapunktene

Klassens spørsmål — lønner det seg å lese? — ble besvart med en komplett statistisk arbeidsgang. Spredningsplottet kom først og viste retning, form, styrke og eventuelle uteliggere; deretter valgte vi regresjonslinjen y^=ax+b\hat{y} = ax + b, definert som linjen som minimerer summen av kvadrerte residualer. Minste kvadraters metode gir formlene for aa og bb, og linjen går alltid gjennom tyngdepunktet (xˉ,yˉ)(\bar{x}, \bar{y}) — i praksis gjør kalkulatoren regningen, men tolkningen er din jobb: stigningstallet 5,39 betydde «5,4 poeng per studietime», og konstantleddet anga forventet resultat uten lesing.

Residualene ei=yiy^ie_i = y_i - \hat{y}_i måler hvert punkts avvik fra modellen — positive over linjen, negative under, og alltid med sum null. Determinasjonskoeffisienten R2=1SSresSStot\displaystyle R^2 = 1 - \frac{\text{SS}_{\text{res}}}{\text{SS}_{\text{tot}}} oppsummerer tilpasningen i ett tall: andelen av variasjonen i yy som modellen forklarer, fra 0 (ingenting) til 1 (perfekt). For studiedataene ga R20,976R^2 \approx 0{,}976 en sjelden sterk sammenheng.

Men to advarsler følger med inn i de neste kapitlene: en sterk samvariasjon beviser ingen årsakssammenheng — det er temaet i 7.2 — og en høy R2R^2 kan skjule at modellformen er feil, som residualanalysen i 7.4 vil avsløre. Regresjonslinjen er et kraftig verktøy, men det er tolkeren som gjør den til kunnskap.

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.