Tilbake
7.3
Lineær regresjon

7.3 Lineær regresjon

Lær å finne den best tilpassede rette linjen til et datasett, tolke korrelasjonskoeffisienten og bruke modellen til å gjøre prediksjoner.

55 min
6 oppgaver
Lineær regresjonKorrelasjonskoeffisientPrediksjonDigitale verktøy
Du leser den lesevennlige versjonen
Din fremgang i kapitlet
0 / 6 oppgaver

Når punktene nesten danner en linje

En bonde har eksperimentert i årevis: hvor mye gjødsel lønner det seg å bruke? Notatboken er full av tall -- 1010 kg gjødsel per dekar ga 320320 kg avling, 2020 kg ga 450450, 4040 kg ga 610610. Tallene spriker, men det aner deg et mønster: mer gjødsel, mer avling. Kan vi fange mønsteret i en formel?

Dette er regresjon: å finne et funksjonsuttrykk som beskriver sammenhengen mellom to størrelser, basert på innsamlede data. Vi møter det overalt -- temperatur målt gjennom døgnet, pris og etterspørsel, treningstimer og løpstid. Avhengig av hvilken funksjonstype vi tilpasser, snakker vi om lineær regresjon (en rett linje), eksponentiell regresjon (en eksponentialfunksjon) eller polynomregresjon (et polynom).

I dette kapittelet holder vi oss til den rette linjen -- og lærer både å finne den, måle hvor godt den passer, og bruke den til å se inn i fremtiden. Med vett.

Spredningsdiagram og regresjonslinjen

Første bud i alt regresjonsarbeid: se på dataene før du regner. Vi plotter punktene i et spredningsdiagram (punktdiagram). Velg hvilken variabel som er den uavhengige (xx -- her gjødselmengden, den bonden styrer selv) og hvilken som er den avhengige (yy -- avlingen, som avhenger av gjødslingen). Så plottes parene: (10,320)(10, 320), (15,370)(15, 370), (20,450)(20, 450), (25,480)(25, 480), (30,530)(30, 530), (35,560)(35, 560) og (40,610)(40, 610).

Og se: punktene ligger tilnærmet langs en stigende rett linje! Da gir det mening å gjøre lineær regresjon: å finne den rette linjen y=ax+by = ax + b som passer best mulig til punktene. «Best» betyr presist at summen av de kvadrerte avstandene mellom punktene og linjen er minst mulig -- minste kvadraters metode. Den utregningen overlater vi trygt til digitale verktøy: i GeoGebra legger du punktene i en liste og skriver RegLin(liste); i et regneark setter du inn et spredningsdiagram og legger til en lineær trendlinje med ligning.

For bondens data gir verktøyet regresjonslinjen:

y=9,5x+237y = 9{,}5x + 237

Nå kan vi tolke: stigningstallet a=9,5a = 9{,}5 betyr at hver ekstra kilo gjødsel per dekar gir omtrent 9,59{,}5 kg mer avling. Konstantleddet b=237b = 237 er modellens anslag for avlingen helt uten gjødsel. En liten kontroll: for x=20x = 20 gir modellen 9,520+237=4279{,}5 \cdot 20 + 237 = 427, mens målingen var 450450 -- et avvik på 2323 kg. Linjen treffer ikke hvert punkt perfekt, og det skal den heller ikke: den fanger trenden i støyete data.

📝Oppgave Quiz 1

Korrelasjon -- hvor godt henger det sammen?

Linjen er funnet, men et spørsmål gjenstår: hvor godt passer den egentlig? Til det trenger vi begrepet korrelasjon -- styrken og retningen på den lineære sammenhengen mellom to variabler.

Tre situasjoner er mulige. Ved positiv korrelasjon øker yy når xx øker -- punktene stiger mot høyre, som temperatur og issalg. Ved negativ korrelasjon minker yy når xx øker -- punktene faller mot høyre, som treningstimer og hvilepuls. Og ved ingen korrelasjon er punktene spredt uten mønster, som skostørrelse og mattekarakterer.

Styrken måles med korrelasjonskoeffisienten rr, et tall mellom 1-1 og 11. Ytterpunktene er perfekte sammenhenger: r=1r = 1 betyr at alle punktene ligger nøyaktig på en stigende linje, r=1r = -1 på en synkende. r=0r = 0 betyr ingen lineær sammenheng. Jo nærmere r|r| er 11, jo strammere klemmer punktene seg rundt linjen. En grei tommelfingerregel for r|r|: over 0,90{,}9 er svært sterkt, 0,70{,}70,90{,}9 sterkt, 0,40{,}40,70{,}7 moderat, 0,20{,}20,40{,}4 svakt, og under 0,20{,}2 svært svakt eller ingenting. (Regneark oppgir ofte R2R^2 i stedet -- det er rett og slett r2r^2.)

For gjødseldataene viser verktøyet r=0,992r = 0{,}992. Positivt fortegn: mer gjødsel henger sammen med større avling. Og 0,9920{,}992 er svært nær 11: en svært sterk lineær sammenheng. Regresjonslinjen vår gir altså svært gode estimater -- i hvert fall innenfor området bonden faktisk har testet. Akkurat det forbeholdet skal vise seg viktig.

📝Oppgave Quiz 2

Prediksjon -- og fellene du må unngå

Nå kommer belønningen: med regresjonslinjen kan bonden predikere -- forutsi avlingen for gjødselmengder han aldri har prøvd. Hva gir 4545 kg per dekar?

y=9,545+237=427,5+237=664,5 kg/daay = 9{,}5 \cdot 45 + 237 = 427{,}5 + 237 = 664{,}5 \text{ kg/daa}

Men vent. Dataene går fra x=10x = 10 til x=40x = 40. Å anslå avlingen for x=22x = 22 er interpolering -- innenfor dataområdet -- og gir vanligvis pålitelige svar. Å anslå for x=45x = 45, og enda verre x=80x = 80, er ekstrapolering -- utenfor området -- og der vet vi ikke om sammenhengen fortsetter. Kanskje skader for mye gjødsel plantene; da bryter den lineære modellen sammen.

Et eksempel viser hvor galt det kan gå. En varmepumpeforhandler registrerte januartemperatur og salg gjennom åtte år, fra 12°C-12\,°C til 2°C2\,°C. Regresjonen ga y=4,7x+28y = -4{,}7x + 28 med r1,00r \approx -1{,}00: svært sterk negativ sammenheng -- kaldere januar, flere solgte pumper. For x=7°Cx = -7\,°C predikerer modellen 4,7(7)+2861-4{,}7 \cdot (-7) + 28 \approx 61 pumper -- trygg interpolering. Men for en sommerdag på 25°C25\,°C? Modellen svarer 4,725+28=89,5-4{,}7 \cdot 25 + 28 = -89{,}5 -- minus nitti varmepumper! Et meningsløst svar: modellen bryter sammen utenfor dataområdet.

Og én felle til, den viktigste av alle: korrelasjon betyr ikke årsak. Issalg og drukningsulykker korrelerer sterkt gjennom året -- men isen drukner ingen. Begge styres av en felles bakenforliggende faktor: varmt vær. Når regresjonen viser sterk sammenheng, spør alltid: gir det mening at xx påvirker yy -- eller kan noe tredje styre begge?

📝Oppgave Quiz 3

Oppsummering

Bondens notatbok ble til en formel -- og underveis lærte vi hele håndverket bak lineær regresjon.

Først tegnet vi et spredningsdiagram for å se om punktene fulgte en linje. Så lot vi et digitalt verktøy (RegLin i GeoGebra, trendlinje i regneark) finne regresjonslinjen y=ax+by = ax + b som passer best etter minste kvadraters metode -- for gjødseldataene y=9,5x+237y = 9{,}5x + 237, der stigningstallet og konstantleddet fikk konkret mening i situasjonen.

Korrelasjonskoeffisienten rr, et tall mellom 1-1 og 11, målte hvor godt linjen passet: r=0,992r = 0{,}992 betydde svært sterk positiv sammenheng. Husk skalaen: r|r| nær 11 er sterkt, nær 00 er svakt.

Med modellen kunne vi predikere -- men med to forbehold. Interpolering innenfor dataområdet er trygt; ekstrapolering utenfor kan gi meningsløse svar, som de 89,5-89{,}5 varmepumpene på en sommerdag. Og fremfor alt: korrelasjon er ikke årsak -- bak issalg og drukningsulykker sto sommervarmen og trakk i begge trådene.

I neste kapittel møter vi data som ikke følger noen rett linje i det heletatt -- og da trenger vi en ny kurve i verktøykassen.

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.