Tilbake
7.3
Lineær regresjon

7.3 Lineær regresjon

Lær å finne den best tilpassede rette linjen til et datasett, tolke korrelasjonskoeffisienten og bruke modellen til å gjøre prediksjoner.

55 min
6 oppgaver
Lineær regresjonKorrelasjonskoeffisientPrediksjonDigitale verktøy
Du leser den tradisjonelle versjonen
Din fremgang i kapitlet
0 / 6 oppgaver

Hva er regresjon?

I mange situasjoner samler vi inn data og ønsker å beskrive sammenhengen mellom to størrelser med et funksjonsuttrykk. Denne prosessen kalles regresjon.

For eksempel kan vi måle temperaturen ute til ulike tidspunkt, registrere pris og etterspørsel for en vare, eller se på sammenhengen mellom treningstimer og løpstid. Når vi har et sett med datapunkter, prøver vi å finne en funksjon som passer best mulig til dataene.

Det finnes ulike typer regresjon avhengig av hvilken funksjonstype vi tilpasser:
- Lineær regresjon – en rett linje
- Eksponentiell regresjon – en eksponentialfunksjon
- Polynomregresjon – et polynom av en gitt grad

I dette kapittelet ser vi på lineær regresjon.

Spredningsdiagram

Før vi gjør regresjon, plotter vi datapunktene i et spredningsdiagram (også kalt punktdiagram). Dette gir oss et visuelt bilde av dataene og hjelper oss å vurdere om en lineær modell er fornuftig.

Hvert datapunkt har en xx-verdi og en yy-verdi, og vi plotter dem som punkter i et koordinatsystem.

Slik lager du et spredningsdiagram:
1. Velg hvilken variabel som er den uavhengige (xx) og hvilken som er den avhengige (yy).
2. Tegn et koordinatsystem med passende akser.
3. Plott alle datapunktene.
4. Vurder visuelt om punktene ser ut til å følge en rett linje, en kurve, eller om det ikke er noen tydelig sammenheng.

✏️Eksempel 1: Lage spredningsdiagram

En bonde registrerer hvor mye gjødsel (kg per dekar) han bruker, og avlingen (kg per dekar) han får:

Gjødsel (kg/daa)10152025303540
Avling (kg/daa)320370450480530560610

a) Plott dataene i et spredningsdiagram.
b) Ser det ut til å være en lineær sammenheng?

Løsning:

a) Vi setter gjødsel på xx-aksen og avling på yy-aksen, og plotter punktene:
(10,320)(10,\, 320), (15,370)(15,\, 370), (20,450)(20,\, 450), (25,480)(25,\, 480), (30,530)(30,\, 530), (35,560)(35,\, 560), (40,610)(40,\, 610).

b) Når vi ser på spredningsdiagrammet, ligger punktene tilnærmet langs en rett linje som stiger fra venstre mot høyre. Det ser altså ut til å være en lineær sammenheng: mer gjødsel gir større avling.

Lineær regresjon
Lineær regresjon er en metode for å finne den rette linjen

y=ax+by = ax + b

som passer best til et sett med datapunkter (x1,y1),(x2,y2),,(xn,yn)(x_1, y_1), (x_2, y_2), \ldots, (x_n, y_n).

Den best tilpassede linjen kalles regresjonslinjen og finnes ved å minimere summen av de kvadrerte avstandene mellom datapunktene og linjen (minste kvadraters metode).

I praksis bruker vi digitale verktøy som regneark eller GeoGebra til å beregne aa og bb.

✏️Eksempel 2: Finne regresjonslinjen

Bruk dataene fra eksempel 1 (gjødsel og avling) og et digitalt verktøy til å finne regresjonslinjen.

Gjødsel (xx)10152025303540
Avling (yy)320370450480530560610

Løsning:

Vi legger inn dataene i GeoGebra eller et regneark og bruker funksjonen for lineær regresjon.

Regresjonslinjen blir:

y=9,5x+237y = 9{,}5x + 237

Her betyr:
- a=9,5a = 9{,}5: for hver ekstra kg gjødsel per dekar øker avlingen med ca. 9,59{,}5 kg per dekar.
- b=237b = 237: modellen anslår en avling på 237237 kg/daa uten gjødsel.

Kontroll: For x=20x = 20: y=9,520+237=190+237=427y = 9{,}5 \cdot 20 + 237 = 190 + 237 = 427. Den faktiske verdien var 450450, så avviket er 2323 kg.

📊Utforsk: Lineær regresjon med RegLin

Datapunktene ligger nesten på en rett linje. Kommandoen RegLin finner linja som passer best til punktene (regresjonslinja, rød). Prøv å dra i et av punktene og se hvordan linja justerer seg.

Korrelasjon

Korrelasjon beskriver styrken og retningen av den lineære sammenhengen mellom to variabler.

Det finnes tre hovedtyper:

- Positiv korrelasjon: Når xx øker, øker også yy. Punktene i spredningsdiagrammet stiger mot høyre. Eksempel: Høyere temperatur → mer issalg.
- Negativ korrelasjon: Når xx øker, minker yy. Punktene faller mot høyre. Eksempel: Flere treningstimer → lavere hvilepuls.
- Ingen korrelasjon: Det er ingen tydelig lineær sammenheng mellom variablene. Punktene er spredt uten mønster. Eksempel: Skostørrelse og karakterer i matematikk.

Korrelasjonskoeffisienten r
Korrelasjonskoeffisienten rr er et tall mellom 1-1 og 11 som angir styrken og retningen til den lineære sammenhengen mellom to variabler.

- r=1r = 1: Perfekt positiv lineær sammenheng (alle punkter på en stigende linje)
- r=1r = -1: Perfekt negativ lineær sammenheng (alle punkter på en synkende linje)
- r=0r = 0: Ingen lineær sammenheng
- r|r| nær 11: Sterk lineær sammenheng
- r|r| nær 00: Svak lineær sammenheng

Tommelfingerregel:

r|r|Styrke
0,91,00{,}9 - 1{,}0Svært sterk
0,70,90{,}7 - 0{,}9Sterk
0,40,70{,}4 - 0{,}7Moderat
0,20,40{,}2 - 0{,}4Svak
0,00,20{,}0 - 0{,}2Svært svak / ingen
✏️Eksempel 3: Tolke korrelasjonskoeffisienten

For gjødsel-avling-dataene finner vi r=0,992r = 0{,}992 med et digitalt verktøy.

a) Er korrelasjonen positiv eller negativ?
b) Hvor sterk er den lineære sammenhengen?
c) Hva betyr dette i praksis?

Løsning:

a) r=0,992>0r = 0{,}992 > 0, så korrelasjonen er positiv. Det betyr at mer gjødsel henger sammen med høyere avling.

b) r=0,992|r| = 0{,}992 er svært nær 11, noe som betyr en svært sterk lineær sammenheng.

c) I praksis betyr dette at det er en nesten perfekt lineær sammenheng mellom gjødselmengde og avling i dette området. Regresjonslinjen gir svært gode estimater.

📝Oppgave 7.6

Avgjør om korrelasjonen er positiv, negativ eller ingen:

a

Antall timer plugging og poengsum på en prøve

b

Bilens alder og salgspris

c

Hårfarge og kroppshøyde

d

Utetemperatur og strømforbruk til oppvarming

Løs oppgavenTren

Bruke regresjonsmodellen til prediksjon

Når vi har funnet regresjonslinjen y=ax+by = ax + b, kan vi bruke den til å forutsi (predikere) yy-verdier for nye xx-verdier.

Eksempel: Hvis regresjonslinjen for gjødsel og avling er y=9,5x+237y = 9{,}5x + 237, kan vi anslå avlingen ved 4545 kg gjødsel per dekar:

y=9,545+237=427,5+237=664,5 kg/daay = 9{,}5 \cdot 45 + 237 = 427{,}5 + 237 = 664{,}5 \text{ kg/daa}

Men vi må være forsiktige med å bruke modellen utenfor datasettet vi har brukt til å lage den.

Interpolering og ekstrapolering

- Interpolering: Vi bruker modellen til å anslå verdier innenfor området til dataene vi har. Dette gir vanligvis pålitelige resultater.
- Ekstrapolering: Vi bruker modellen til å anslå verdier utenfor det kjente dataområdet. Dette er mer usikkert fordi vi ikke vet om sammenhengen fortsetter på samme måte.

Eksempel: Gjødseldataene våre går fra x=10x = 10 til x=40x = 40.
- Å beregne avling for x=22x = 22 er interpolering (innenfor intervallet).
- Å beregne avling for x=80x = 80 er ekstrapolering (utenfor intervallet). Kanskje for mye gjødsel skader plantene — da stemmer ikke en lineær modell lenger.

✏️Eksempel 4: Regresjon med digitale verktøy

En bedrift selger varmepumper. Tabellen viser gjennomsnittlig utetemperatur i januar (xx, i °C°C) og antall solgte varmepumper den måneden (yy) over åtte år:

Temperatur (°C°C)12-128-85-53-3002210-106-6
Antall solgt8465524028187558

a) Bruk et digitalt verktøy til å finne regresjonslinjen.
b) Hva er korrelasjonskoeffisienten? Tolk svaret.

c) Bruk modellen til å anslå salget hvis januartemperaturen er 7°C-7\,°C.
d) Ville det vært fornuftig å bruke modellen for å anslå salget ved 25°C25\,°C?

Løsning:

a) Vi legger inn dataene i GeoGebra eller et regneark og gjør lineær regresjon. Regresjonslinjen blir:

y=4,7x+28y = -4{,}7x + 28

b) Korrelasjonskoeffisienten er r1,00r \approx -1{,}00.

- Korrelasjonen er negativ: lavere temperatur gir flere solgte varmepumper.
- r1,00|r| \approx 1{,}00 betyr en svært sterk lineær sammenheng.

c) For x=7x = -7:
y=4,7(7)+28=32,9+28=60,9y = -4{,}7 \cdot (-7) + 28 = 32{,}9 + 28 = 60{,}9
Modellen anslår ca. 6161 solgte varmepumper.

Dette er interpolering (innenfor dataområdet 12-12 til 22), så estimatet er rimelig.

d) 25°C25\,°C er langt utenfor dataområdet. Dette er ekstrapolering:
y=4,725+28=117,5+28=89,5y = -4{,}7 \cdot 25 + 28 = -117{,}5 + 28 = -89{,}5

Et negativt antall gir ingen mening. Modellen bryter ned utenfor dataområdet, og ekstrapolering er ikke fornuftig her.

📝Oppgave 7.7

En sportskjede har registrert sammenhengen mellom annonsekostnader (xx, i tusen kroner) og omsetning (yy, i tusen kroner) over seks måneder:

Annonsekostnader (xx)51015202530
Omsetning (yy)120180230310350420

a

Bruk et digitalt verktøy til å finne regresjonslinjen.

b

Finn korrelasjonskoeffisienten og tolk den.

c

Bruk modellen til å anslå omsetningen dersom bedriften bruker 18 000 kr på annonser.

d

Er det fornuftig å bruke modellen til å anslå omsetningen ved annonsekostnader på 100 000 kr? Begrunn svaret.

📝Oppgave 7.8

En forsker undersøker sammenhengen mellom daglig skjermtid (xx, i timer) og søvnkvalitet (yy, skala 111010) hos en gruppe ungdommer:

Skjermtid (timer)12345678
Søvnkvalitet8,58,07,26,86,05,54,84,2

a

Finn regresjonslinjen og korrelasjonskoeffisienten.

b

Tolk stigningstallet og konstantleddet i modellen.

c

Kan vi konkludere med at skjermtid forårsaker dårligere søvn? Begrunn.

Oppsummering

I dette kapittelet har du lært:

- Spredningsdiagram: Plott av datapunkter som viser sammenhengen mellom to størrelser.
- Lineær regresjon: Å finne den rette linjen y=ax+by = ax + b som passer best til datapunktene — gjøres digitalt.
- Korrelasjonskoeffisienten rr: Tall mellom 1-1 og 11 som måler hvor sterk den lineære sammenhengen er.
- Interpolering (innenfor dataområdet) er tryggere enn ekstrapolering (utenfor).
- Korrelasjon er ikke årsak: At to størrelser samvarierer, beviser ikke at den ene forårsaker den andre.

Nøkkelbegreper


BegrepForklaring
RegresjonslinjeLinjen som passer dataene best
KorrelasjonSamvariasjon mellom to størrelser
InterpoleringBruke modellen innenfor datapunktene
EkstrapoleringBruke modellen utenfor datapunktene

Husk


- rr nær 11 eller 1-1: sterk lineær sammenheng. rr nær 00: svak sammenheng
Repetisjonsoppgaver
Din fremgang
0deloppgaver0 / 3 oppgaver

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.