Tilbake
6.1
Lineær regresjon

6.1 Lineær regresjon

Minste kvadraters metode og regresjonsanalyse.

55 min
21 oppgaver
Lineær regresjonMinste kvadratRegresjonslinjePrediksjon
Du leser den lesevennlige versjonen
Din fremgang i kapitlet
0 / 21 oppgaver

Linjen som forklarer salget

Tenk deg at du har sommerjobb i en liten nettbutikk. Sjefen din lurer på om pengene hun bruker på annonsering faktisk gir mer salg, og hun viser deg tallene: når butikken brukte 1 tusen kroner på annonser, solgte de 3 tusen enheter. Med 2 tusen kroner ble det 5 tusen enheter, med 3 tusen ble det 6, med 4 tusen ble det 8, og med 5 tusen ble det 9. «Ser du et mønster her?» spør hun.

Du plotter punktene og ser at de ligger nesten på en rett linje. Men bare nesten — ingen rett linje treffer alle punktene perfekt. Spørsmålet blir da: hvilken linje passer best? Dette er kjernen i lineær regresjon, en statistisk metode for å finne den rette linjen som best beskriver sammenhengen mellom to variabler.

Vi kaller annonsebudsjettet xx for forklaringsvariabelen (den uavhengige variabelen — den vi bruker til å forklare eller predikere) og salget yy for responsvariabelen (den avhengige variabelen — den vi ønsker å forklare). Når vi har nn observasjonspar (x1,y1),(x2,y2),,(xn,yn)(x_1, y_1), (x_2, y_2), \ldots, (x_n, y_n), leter vi etter linjen

y^=ax+b\hat{y} = ax + b

der y^\hat{y} («y-hatt») er den predikerte verdien av yy for en gitt xx. I denne fortellingen skal vi finne ut hvordan vi beregner linjen, hvordan vi måler hvor god den er, og hvor grensen går for hva den kan fortelle oss.

Minste kvadraters metode

Hvordan avgjør vi hvilken linje som passer «best»? Idéen er like enkel som den er genial: for hvert datapunkt måler vi den vertikale avstanden fra punktet til linjen, kvadrerer den (slik at positive og negative avvik ikke utligner hverandre), og summerer. Minste kvadraters metode (MKM) finner koeffisientene aa og bb som gjør denne summen minst mulig:

SSE=i=1n(yiy^i)2=i=1n(yiaxib)2\text{SSE} = \sum_{i=1}^{n} (y_i - \hat{y}_i)^2 = \sum_{i=1}^{n} (y_i - ax_i - b)^2

SSE står for Sum of Squared Errors — summen av kvadratavvikene. Metoden gir oss konkrete formler. Stigningstallet blir

a=nxiyixiyinxi2(xi)2a = \frac{n\sum x_i y_i - \sum x_i \sum y_i}{n\sum x_i^2 - (\sum x_i)^2}

og konstantleddet b=yˉaxˉb = \bar{y} - a\bar{x}, der xˉ\bar{x} og yˉ\bar{y} er gjennomsnittene. En fin konsekvens av dette er at regresjonslinjen alltid går gjennom tyngdepunktet (xˉ,yˉ)(\bar{x}, \bar{y}) i datasettet.

La oss regne på nettbutikkens tall. Vi har n=5n = 5, xˉ=3\bar{x} = 3 og yˉ=6,2\bar{y} = 6{,}2. Hjelpesummene blir xiyi=3+10+18+32+45=108\sum x_i y_i = 3 + 10 + 18 + 32 + 45 = 108, xi=15\sum x_i = 15, yi=31\sum y_i = 31 og xi2=55\sum x_i^2 = 55. Da får vi

a=51081531555152=540465275225=7550=1,5a = \frac{5 \cdot 108 - 15 \cdot 31}{5 \cdot 55 - 15^2} = \frac{540 - 465}{275 - 225} = \frac{75}{50} = 1{,}5

og b=6,21,53=1,7b = 6{,}2 - 1{,}5 \cdot 3 = 1{,}7. Regresjonslinjen er altså y^=1,5x+1,7\hat{y} = 1{,}5x + 1{,}7. Tolkningen kan du servere sjefen din direkte: for hver ekstra tusenlapp i annonsering øker salget med omtrent 1500 enheter. Konstantleddet b=1,7b = 1{,}7 er det predikerte salget helt uten annonsering.

📝Oppgave Quiz 1

Residualer og forklaringsgraden

Linjen er funnet — men hvor godt passer den egentlig? For å svare på det ser vi på residualene: forskjellen mellom det vi observerte og det modellen predikerte, ei=yiy^ie_i = y_i - \hat{y}_i. For nettbutikken gir y^=1,5x+1,7\hat{y} = 1{,}5x + 1{,}7 de predikerte verdiene 3,23{,}2; 4,74{,}7; 6,26{,}2; 7,77{,}7 og 9,29{,}2, og residualene blir 0,2-0{,}2; 0,30{,}3; 0,2-0{,}2; 0,30{,}3 og 0,2-0{,}2. Legg merke til at summen er null — det gjelder alltid for MKM. Residualene er små og veksler i fortegn, et godt tegn.

For å se etter mønstre tegner vi et residualplott, der residualene eie_i plottes mot xix_i. Et godt residualplott viser tilfeldig spredning rundt null med omtrent lik spredning over hele området. Tre mønstre varsler trøbbel: krumning betyr at en lineær modell ikke passer og at vi bør prøve ikke-lineær regresjon, en vifteform betyr at variasjonen øker og forutsetningen om konstant varians er brutt, og klynger kan tyde på gruppering i dataene.

Vi kan også tallfeste kvaliteten med forklaringsgraden R2R^2, som måler hvor stor andel av variasjonen i yy modellen forklarer:

R2=1SSESST=1(yiy^i)2(yiyˉ)2R^2 = 1 - \frac{\text{SSE}}{\text{SST}} = 1 - \frac{\sum(y_i - \hat{y}_i)^2}{\sum(y_i - \bar{y})^2}

Her er SSE den uforklarte variasjonen og SST den totale variasjonen rundt gjennomsnittet. R2=0R^2 = 0 betyr at modellen ikke forklarer noe, R2=1R^2 = 1 betyr perfekt tilpasning. For nettbutikken blir SSE=0,04+0,09+0,04+0,09+0,04=0,30\text{SSE} = 0{,}04 + 0{,}09 + 0{,}04 + 0{,}09 + 0{,}04 = 0{,}30 og SST=10,24+1,44+0,04+3,24+7,84=22,80\text{SST} = 10{,}24 + 1{,}44 + 0{,}04 + 3{,}24 + 7{,}84 = 22{,}80, så

R2=10,3022,800,987R^2 = 1 - \frac{0{,}30}{22{,}80} \approx 0{,}987

Hele 98,7 % av variasjonen i salget forklares av annonseringen. For enkel lineær regresjon gjelder dessuten at R2=r2R^2 = r^2, kvadratet av korrelasjonskoeffisienten — den skal vi møte i neste kapittel.

📝Oppgave Quiz 2

Prediksjon — og fellen ved å gå for langt

Sjefen din er begeistret. «Hvis vi bruker 20 tusen på annonser, selger vi altså 1,520+1,7=31,71{,}5 \cdot 20 + 1{,}7 = 31{,}7 tusen enheter!» Her bør du trekke i nødbremsen. Å bruke modellen til å anslå yy for en gitt xx kalles prediksjon, og det finnes to varianter med svært ulik pålitelighet.

Interpolering er prediksjon for xx-verdier innenfor området til de observerte dataene. Butikken har data for annonsering mellom 1 og 5 tusen kroner, så å predikere salget ved x=3,5x = 3{,}5 er rimelig trygt: y^=1,53,5+1,7=6,95\hat{y} = 1{,}5 \cdot 3{,}5 + 1{,}7 = 6{,}95 tusen enheter.

Ekstrapolering er prediksjon utenfor det observerte området — som sjefens x=20x = 20. Det kan være svært upålitelig, for vi vet ikke om det lineære mønsteret fortsetter. I virkeligheten finnes det gjerne en metningseffekt: når alle som er interessert i produktet allerede har sett annonsen, gir flere annonsekroner stadig mindre igjen. Modellen vår vet ingenting om dette, for den har aldri «sett» data der ute.

Tommelfingerregelen er altså: stol på modellen innenfor dataområdet, og vær skeptisk — gjerne åpent kritisk — til prediksjoner langt utenfor. En god statistiker leverer ikke bare et tall, men også en vurdering av hvor mye tallet er verdt.

📝Oppgave Quiz 3

Oppsummering: fra punktsky til innsikt

Fortellingen om nettbutikken viser hele arbeidsflyten i lineær regresjon. Vi startet med en punktsky og et spørsmål: henger annonsering og salg sammen? Minste kvadraters metode ga oss linjen y^=ax+b\hat{y} = ax + b som minimerer summen av kvadrerte residualer, med stigningstall a=nxiyixiyinxi2(xi)2\displaystyle a = \frac{n\sum x_iy_i - \sum x_i \sum y_i}{n\sum x_i^2 - (\sum x_i)^2} og konstantledd b=yˉaxˉb = \bar{y} - a\bar{x}. Linjen går alltid gjennom tyngdepunktet (xˉ,yˉ)(\bar{x}, \bar{y}).

Deretter kvalitetssjekket vi modellen. Residualene ei=yiy^ie_i = y_i - \hat{y}_i summerer seg alltid til null, og et residualplott uten systematiske mønstre — ingen krumning, vifte eller klynger — tyder på god tilpasning. Forklaringsgraden R2=1SSESST\displaystyle R^2 = 1 - \frac{\text{SSE}}{\text{SST}} tallfester hvor stor andel av variasjonen i yy modellen forklarer; for nettbutikken var den hele 98,7 %.

Til slutt brukte vi modellen med fornuft: interpolering innenfor dataområdet er vanligvis trygt, mens ekstrapolering utenfor kan lede galt av sted fordi mønsteret ikke nødvendigvis fortsetter. Stigningstallet forteller hvor mye responsen endrer seg per enhet, konstantleddet er predikert verdi når x=0x = 0 — og en høy R2R^2 er et godt tegn, men aldri en garanti. Neste steg er å måle styrken på samvariasjonen direkte, med korrelasjonskoeffisienten rr.

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.