Tilbake
2.3
Regresjon

2.3 Regresjon

En fortelling om å finne mønstre i data og velge riktig modell.

35 min
5 oppgaver
Lineær regresjonKorrelasjonModellvalg
Du leser den lesevennlige versjonen
Din fremgang i kapitlet
0 / 5 oppgaver

Regresjon -- å finne mønster i kaos

I de to forrige kapitlene har vi laget modeller fra bunnen av: vi visste at en taxi tar 60 kroner pluss 15 per km, og skrev opp funksjonen direkte. Men i virkeligheten starter vi ofte den andre veien -- med en haug datapunkter og spørsmålet: Finnes det et mønster her?

Kanskje du har målt temperaturen hver time gjennom en dag. Eller registrert sammenhengen mellom treningsmengde og hvilepuls. Eller logget verdien av en bruktbil over flere år. Datapunktene ligger nesten på en linje -- eller en kurve -- men ikke helt. Regresjon er kunsten å finne den funksjonen som passer best mulig til dataene dine.

Lineær regresjon -- den beste rette linjen

Lineær regresjon finner den rette linjen y=ax+by = ax + b som ligger nærmest mulig alle datapunktene. Metoden kalles minste kvadraters metode: den minimerer summen av de kvadrerte avstandene mellom datapunktene og linjen. Du trenger heldigvis ikke gjøre dette for hånd -- GeoGebra, Excel og kalkulatorer gjør det for deg.

La oss se det i praksis. Temperaturen ble målt hver time fra kl. 08 til kl. 14:

Tid (t)0123456
Temp (°C)57811121315

Et digitalt verktøy gir oss: f(t)=1,61t+5,14f(t) = 1{,}61t + 5{,}14 med r=0,995r = 0{,}995.
Hva betyr r=0,995r = 0{,}995? Det er korrelasjonskoeffisienten, og den måler hvor godt den rette linjen passer til dataene. r=1r = 1 betyr perfekt positiv sammenheng (alle punkter på en stigende linje). r=1r = -1 betyr perfekt negativ sammenheng. r=0r = 0 betyr ingen lineær sammenheng i det hele tatt.

I vårt tilfelle er r=0,995r = 0{,}995, altså nesten perfekt. Temperaturen stiger med ca. 1,6 °C per time.

Vi kan bruke modellen til å forutsi: Hva er temperaturen kl. 16 (altså t=8t = 8)? f(8)=1,618+5,14=18,0°Cf(8) = 1{,}61 \cdot 8 + 5{,}14 = 18{,}0°C. Men vær forsiktig -- modellen gjelder neppe utenfor måleperioden. Kl. 22 (t = 14) ville modellen gi f(14)=27,7°Cf(14) = 27{,}7°C, noe som er usannsynlig i Norge.

📝Oppgave Quiz 1

Korrelasjonskoeffisienten -- hvor sterk er sammenhengen?

La oss dvele litt ved rr-verdien, for den er et nøkkelverktøy i regresjonsanalyse. Her er en guide:

Når r>0,9|r| > 0{,}9 har vi sterk korrelasjon. Punktene ligger tett inntil linjen, og modellen er pålitelig. Når 0,7<r<0,90{,}7 < |r| < 0{,}9 har vi middels korrelasjon. Det er en tydelig sammenheng, men med mer spredning. Når r<0,5|r| < 0{,}5 har vi svak korrelasjon. En lineær modell er trolig ikke den beste beskrivelsen.

r2r^2 -- korrelasjonskoeffisienten i andre potens -- kalles forklart varians. Den forteller hvor stor andel av variasjonen i dataene som forklares av modellen. Hvis r=0,995r = 0{,}995, er r2=0,990r^2 = 0{,}990. Det betyr at 99 prosent av variasjonen i temperaturen forklares av tiden -- bare 1 prosent er tilfeldig variasjon.

La oss se på et nytt eksempel. Sammenhengen mellom ukentlig trening og hvilepuls ble undersøkt:

Timer trening0246810
Hvilepuls787268636056

Lineær regresjon gir: f(x)2,13x+77,5f(x) \approx -2{,}13x + 77{,}5 med r0,998r \approx -0{,}998. Sammenhengen er sterkt negativ -- mer trening gir lavere hvilepuls. For en person som trener 7 timer per uke: f(7)=2,137+77,562,6f(7) = -2{,}13 \cdot 7 + 77{,}5 \approx 62{,}6 slag per minutt.
Legg merke til at rr er negativ fordi sammenhengen er negativ: mer trening gir lavere puls. Styrken på sammenhengen avgjøres av r|r|, altså absoluttverdien.
📝Oppgave Quiz 2

Eksponentiell regresjon -- når linjen ikke passer

Noen ganger ser du tydelig at datapunktene ikke følger en rett linje. De bøyer oppover eller nedover. Da kan eksponentiell regresjon gi bedre tilpasning. Metoden finner tallene aa og bb i modellen f(x)=abxf(x) = a \cdot b^x.

Her er verdien av en bil over flere år:

År012345
Verdi (1000 kr)350290245200168140

Eksponentiell regresjon gir: f(t)=3490,833tf(t) = 349 \cdot 0{,}833^t med r2=0,998r^2 = 0{,}998. Tolkning: Bilen mister ca. 10,833=16,71 - 0{,}833 = 16{,}7 prosent av verdien hvert år. Startverdien i modellen (349 000 kr) er svært nær den faktiske (350 000 kr).
Et annet eksempel: Bakterier i en kultur ble telt over noen timer:

Timer012345
Antall100150230340510780

Her kurver tallene tydelig oppover. Eksponentiell regresjon gir: f(t)99,51,51tf(t) \approx 99{,}5 \cdot 1{,}51^t. Vekstprosenten er ca. 51 prosent per time! Etter 8 timer: f(8)99,525,62547f(8) \approx 99{,}5 \cdot 25{,}6 \approx 2\,547 bakterier.

Husk at du trenger et digitalt verktøy for regresjon. I GeoGebra bruker du kommandoene FitLinje for lineær og FitExp for eksponentiell regresjon. I Excel bruker du diagramverktøyet med trendlinje.

📝Oppgave Quiz 3

Modellvalg -- lineær eller eksponentiell?

Ofte har du data og vet ikke på forhånd hvilken modell som passer best. Her er en oppskrift:

Steg 1: Plot dataene. Lag et punktdiagram og se. Følger punktene en rett linje? Eller bøyer de opp eller ned? Det visuelle inntrykket er ofte en god pekepinn.

Steg 2: Kjør begge regresjoner. Bruk digitalt verktøy til å gjøre både lineær og eksponentiell regresjon. Sammenlign r2r^2-verdiene. Den modellen med høyest r2r^2 forklarer mest av variasjonen i dataene.

Steg 3: Vurder konteksten. Hva gir mening i situasjonen? Strømforbruk som avtar med en fast prosent? Eller med et fast beløp? Noen ganger forteller fagets logikk deg hvilken modell som er riktig, selv om r2r^2-verdiene er like.

Steg 4: Vær forsiktig med ekstrapolering. Å bruke modellen langt utenfor dataintervallet er risikabelt. Temperaturmodellen vår forutsa 18 °C kl. 16, noe som er rimelig. Men kl. 22 ga den 27,7 °C -- tydelig feil. Modeller er gode innenfor dataintervallet, men upålitelige langt utenfor.

Tommelfingerregel: Velg den enkleste modellen som gir god tilpasning (r2>0,9r^2 > 0{,}9). Hvis begge modeller gir nesten lik r2r^2, velg den som gir mest mening i sammenhengen.

Et godt eksempel: For et datasett gir lineær regresjon r2=0,87r^2 = 0{,}87 og eksponentiell regresjon r2=0,96r^2 = 0{,}96. Den eksponentielle modellen forklarer 96 prosent av variasjonen mot 87 prosent for den lineære. Valget er klart.

📝Oppgave Quiz 4

Regresjon i praksis -- et realistisk eksempel

La oss avslutte med et eksempel som viser hvordan modellvalg ikke alltid er opplagt. Strømforbruket i en bolig ble registrert fra januar til juni:

MånedJanFebMarAprMaiJun
kWh2 4002 1001 7001 200800600

Med x=1x = 1 for januar osv., gir lineær regresjon f(x)360x+2720f(x) \approx -360x + 2\,720 med r20,99r^2 \approx 0{,}99. Eksponentiell regresjon gir f(x)30700,77xf(x) \approx 3\,070 \cdot 0{,}77^x med r20,99r^2 \approx 0{,}99. Begge modeller passer utmerket! Hvordan velger vi?
Tenk på juli (x=7x = 7). Lineær: f(7)=3607+2720=200f(7) = -360 \cdot 7 + 2\,720 = 200 kWh. Eksponentiell: f(7)=30700,777480f(7) = 3\,070 \cdot 0{,}77^7 \approx 480 kWh. Og i september (x=9x = 9)? Lineær: f(9)=3609+2720=520f(9) = -360 \cdot 9 + 2\,720 = -520 kWh -- negativt strømforbruk! Det gir ingen mening. Den eksponentielle modellen gir f(9)285f(9) \approx 285 kWh, som i det minste er positivt.

Her vinner den eksponentielle modellen fordi strømforbruket naturlig flater ut -- du kan ikke bruke negativt med strøm. Lineære modeller som gir negative verdier for noe som ikke kan være negativt, er et klassisk varselsignal om at modellen er feil.

Neste gang du har data og lurer på sammenhengen -- prøv begge modelltyper, sammenlign r2r^2, og vurder hva som gir mening. Regresjon er ikke bare matematikk -- det er også sunn fornuft.

📝Oppgave Quiz 5

Oppsummering

Regresjon er et kraftig verktøy for å finne mønstre i data og lage modeller vi kan bruke til å forstå sammenhenger og gjøre prediksjoner.

Nøkkelbegreper du nå kjenner:
- Regresjon: Finne funksjonen som passer best til datapunkter
- Lineær regresjon: y=ax+by = ax + b -- den beste rette linjen gjennom dataene
- Eksponentiell regresjon: y=abxy = a \cdot b^x -- den beste eksponentielle kurven
- Minste kvadraters metode: Minimerer summen av kvadrerte avvik fra modellen
- Korrelasjonskoeffisienten rr: Måler styrken på lineær sammenheng (1-1 til 11)
- r2r^2 (forklart varians): Andelen av variasjon forklart av modellen
- Ekstrapolering: Å bruke modellen utenfor dataintervallet -- vær forsiktig!

Det viktigste du tar med deg:
Data alene forteller deg ingenting -- du må finne mønsteret. Regresjon er verktøyet som avslører sammenhengen bak tallene. Men husk: en modell er bare så god som forutsetningene den bygger på. Velg modell med omhu, vurder r2r^2, og bruk sunn fornuft. Og vær spesielt forsiktig med å forutsi langt utenfor dataene du har.

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.