Tilbake
7.3
Lineær regresjon

7.3 Lineær regresjon

Lær å finne den best tilpassede rette linjen til et datasett, tolke korrelasjonskoeffisienten og bruke modellen til å gjøre prediksjoner.

55 min
6 oppgaver
Lineær regresjonKorrelasjonskoeffisientPrediksjonDigitale verktøy
Du leser den tradisjonelle versjonen
Din fremgang i kapitlet
0 / 6 oppgaver

Kva er regresjon?

I mange situasjonar samlar vi inn data og ønskjer å beskrive samanhengen mellom to storleikar med eit funksjonsuttrykk. Denne prosessen kallast regresjon.

For eksempel kan vi måle temperaturen ute til ulike tidspunkt, registrere pris og etterspørnad for ei vare, eller sjå på samanhengen mellom treningsstundar og løpstid. Når vi har eit sett med datapunkt, prøver vi å finne ei funksjon som passar best mogleg til dataene.

Det finst ulike typar regresjon avhengig av kva funksjonstype vi tilpassar:
- Lineær regresjon – ei rett linje
- Eksponentiell regresjon – ei eksponentialfunksjon
- Polynomregresjon – eit polynom av ei gjeven grad

I dette kapitlet ser vi på lineær regresjon.

Spredningsdiagram

Før vi gjer regresjon, plottar vi datapunkta i eit spredningsdiagram (også kalla punktdiagram). Dette gir oss eit visuelt bilete av dataene og hjelper oss å vurdere om ein lineær modell er fornuftig.

Kvert datapunkt har ein xx-verdi og ein yy-verdi, og vi plottar dei som punkt i eit koordinatsystem.

Slik lagar du eit spredningsdiagram:
1. Vel kva variabel som er den uavhengig (xx) og kva som er den avhengig (yy).
2. Teikn eit koordinatsystem med passande aksar.
3. Plott alle datapunkta.
4. Vurder visuelt om punkta ser ut til å følgje ei rett linje, ei kurve, eller om det ikkje er nokon tydleg samanheng.

✏️Døme 1: Lage spredningsdiagram

Ein bonde registrerer kor mykje gjødsel (kg per dekar) han bruker, og avlinga (kg per dekar) han får:

Gjødsel (kg/daa)10152025303540
Avling (kg/daa)320370450480530560610

a) Plott dataene i eit spredningsdiagram.
b) Ser det ut til å vere ei lineær samanheng?

Løysing:

a) Vi set gjødsel på xx-aksen og avling på yy-aksen, og plottar punkta:
(10,320)(10,\, 320), (15,370)(15,\, 370), (20,450)(20,\, 450), (25,480)(25,\, 480), (30,530)(30,\, 530), (35,560)(35,\, 560), (40,610)(40,\, 610).

b) Når vi ser på spredningsdiagrammet, ligg punkta tilnærma langs ei rett linje som stig frå venstre mot høgre. Det ser altso ut til å vere ei lineær samanheng: meir gjødsel gir større avling.

Lineær regresjon
Lineær regresjon er ein metode for å finne den reta linja

y=ax+by = ax + b

som passar best til eit sett med datapunkt (x1,y1),(x2,y2),,(xn,yn)(x_1, y_1), (x_2, y_2), \ldots, (x_n, y_n).

Den best tilpassa linja kallast regresjonslinjen og finnast ved å minimere summen av dei kvadrerte avstanda mellom datapunkta og linja (minste kvadraters metode).

I praksis bruker vi digitale verktøy som rekneark eller GeoGebra til å berekne aa og bb.

✏️Døme 2: Finne regresjonslinjen

Bruk dataene frå døme 1 (gjødsel og avling) og eit digitalt verktøy til å finne regresjonslinjen.

Gjødsel (xx)10152025303540
Avling (yy)320370450480530560610

Løysing:

Vi legg inn dataene i GeoGebra eller eit rekneark og bruker funksjonen for lineær regresjon.

Regresjonslinjen blir:

y=9,5x+237y = 9{,}5x + 237

Her betyr:
- a=9,5a = 9{,}5: for kvar ekstra kg gjødsel per dekar aukar avlinga med ca. 9,59{,}5 kg per dekar.
- b=237b = 237: modellen anslo ei avling på 237237 kg/daa utan gjødsel.

Kontroll: For x=20x = 20: y=9,520+237=190+237=427y = 9{,}5 \cdot 20 + 237 = 190 + 237 = 427. Den faktiske verdien var 450450, så avviket er 2323 kg.

📊Utforsk: Lineær regresjon med RegLin

Datapunkta ligg nesten på ei rett linje. Kommandoen RegLin finn linja som passar best til punkta (regresjonslinjen, raud). Prøv å dra i eit av punkta og sjå korleis linja justerer seg.

Korrelasjon

Korrelasjon beskriver styrken og retninga av den lineære samanhengen mellom to variablar.

Det finst tre hovudtypar:

- Positiv korrelasjon: Når xx aukar, aukar også yy. Punkta i spredningsdiagrammet stig mot høgre. Døme: Høgare temperatur → meir issalg.
- Negativ korrelasjon: Når xx aukar, minkkar yy. Punkta fell mot høgre. Døme: Fleire treningsstundar → lågare kvilepuls.
- Ingen korrelasjon: Det er ingen tydleg lineær samanheng mellom variablane. Punkta er spreidd utan mønster. Døme: Skostørrelse og karakterar i matematikk.

Korrelasjonskoeffisienten r
Korrelasjonskoeffisienten rr er eit tal mellom 1-1 og 11 som angir styrken og retninga til den lineære samanhengen mellom to variablar.

- r=1r = 1: Perfekt positiv lineær samanheng (alle punkt på ei stigande linje)
- r=1r = -1: Perfekt negativ lineær samanheng (alle punkt på ei synkande linje)
- r=0r = 0: Ingen lineær samanheng
- r|r| nær 11: Sterk lineær samanheng
- r|r| nær 00: Svak lineær samanheng

Tommelfingerregel:

r|r|Styrke
0,91,00{,}9 - 1{,}0Svært sterk
0,70,90{,}7 - 0{,}9Sterk
0,40,70{,}4 - 0{,}7Moderat
0,20,40{,}2 - 0{,}4Svak
0,00,20{,}0 - 0{,}2Svært svak / ingen
✏️Døme 3: Tolke korrelasjonskoeffisienten

For gjødsel-avling-dataene finn vi r=0,992r = 0{,}992 med eit digitalt verktøy.

a) Er korrelasjonen positiv eller negativ?
b) Kor sterk er den lineære samanhengen?
c) Kva betyr dette i praksis?

Løysing:

a) r=0,992>0r = 0{,}992 > 0, så korrelasjonen er positiv. Det betyr at meir gjødsel heng saman med høgare avling.

b) r=0,992|r| = 0{,}992 er svært nær 11, noko som betyr ein svært sterk lineær samanheng.

c) I praksis betyr dette at det er ei nesten perfekt lineær samanheng mellom gjødselmengde og avling i dette området. Regresjonslinjen gir svært gode estimat.

📝Oppgave 7.6

Avgjerd om korrelasjonen er positiv, negativ eller ingen:

a

Antal stundar plugging og poengsum på ei prøve

b

Bilens alder og salgspris

c

Hårfarge og kroppshøyde

d

Utetemperatur og straumforbruk til oppvarming

Løs oppgavenTren

Bruke regresjonsmodellen til prediksjon

Når vi har funne regresjonslinjen y=ax+by = ax + b, kan vi bruke ho til å forutsjå (predikere) yy-verdiar for nye xx-verdiar.

Døme: Hvis regresjonslinjen for gjødsel og avling er y=9,5x+237y = 9{,}5x + 237, kan vi anslo avlinga ved 4545 kg gjødsel per dekar:

y=9,545+237=427,5+237=664,5 kg/daay = 9{,}5 \cdot 45 + 237 = 427{,}5 + 237 = 664{,}5 \text{ kg/daa}

Men vi må vere forsiktige med å bruke modellen utanfor datasettet vi har brukt til å lage ho.

Interpolering og ekstrapolering

- Interpolering: Vi bruker modellen til å anslo verdiar innanfor området til dataene vi har. Dette gir vanlegvis pålitelege resultat.
- Ekstrapolering: Vi bruker modellen til å anslo verdiar utanfor det kjende dataområdet. Dette er meir usikkert fordi vi ikkje veit om samanhengen fortsett på same måte.

Døme: Gjødseldataene våre går frå x=10x = 10 til x=40x = 40.
- Å berekne avling for x=22x = 22 er interpolering (innanfor intervallet).
- Å berekne avling for x=80x = 80 er ekstrapolering (utanfor intervallet). Kanskje for mykje gjødsel skadar plantene — då stemmer ikkje ein lineær modell lenger.

✏️Døme 4: Regresjon med digitale verktøy

Ein bedrift sel varmepumper. Tabellen viser gjennomsnittleg utetemperatur i januar (xx, i °C°C) og antal selde varmepumper den månaden (yy) over åtte år:

Temperatur (°C°C)12-128-85-53-3002210-106-6
Antal solgt8465524028187558

a) Bruk eit digitalt verktøy til å finne regresjonslinjen.
b) Kva er korrelasjonskoeffisienten? Tolk svaret.

c) Bruk modellen til å anslo salet hvis januartemperaturen er 7°C-7\,°C.
d) Ville det vore fornuftig å bruke modellen til å anslo salet ved 25°C25\,°C?

Løysing:

a) Vi legg inn dataene i GeoGebra eller eit rekneark og gjer lineær regresjon. Regresjonslinjen blir:

y=4,7x+28y = -4{,}7x + 28

b) Korrelasjonskoeffisienten er r1,00r \approx -1{,}00.

- Korrelasjonen er negativ: lågare temperatur gir fleire selde varmepumper.
- r1,00|r| \approx 1{,}00 betyr ein svært sterk lineær samanheng.

c) For x=7x = -7:
y=4,7(7)+28=32,9+28=60,9y = -4{,}7 \cdot (-7) + 28 = 32{,}9 + 28 = 60{,}9
Modellen anslo ca. 6161 selde varmepumper.

Detta er interpolering (innanfor dataområdet 12-12 til 22), så estimatet er rimelegleg.

d) 25°C25\,°C er langt utanfor dataområdet. Dette er ekstrapolering:
y=4,725+28=117,5+28=89,5y = -4{,}7 \cdot 25 + 28 = -117{,}5 + 28 = -89{,}5

Eit negativt antal gir ingen meining. Modellen bryt ned utanfor dataområdet, og ekstrapolering er ikkje fornuftig her.

📝Oppgave 7.7

Ein sportskjede har registrert samanhengen mellom annonsekostnader (xx, i tusen kroner) og omsetning (yy, i tusen kroner) over seks månader:

Annonsekostnader (xx)51015202530
Omsetning (yy)120180230310350420

a

Bruk eit digitalt verktøy til å finne regresjonslinjen.

b

Finn korrelasjonskoeffisienten og tolk ho.

c

Bruk modellen til å anslå omsetningen dersom bedrifta bruker 18 000 kr på annonser.

d

Er det fornuftig å bruke modellen til å anslå omsetningen ved annonsekostnader på 100 000 kr? Grunngiv svaret.

📝Oppgave 7.8

Ein forskar undersøkjer samanhangen mellom dagleg skjermtid (xx, i timar) og søvnkvalitet (yy, skala 111010) hjå ei gruppe ungdommar:

Skjermtid (timar)12345678
Søvnkvalitet8,58,07,26,86,05,54,84,2

a

Finn regresjonslinjen og korrelasjonskoeffisienten.

b

Tolk stigningstalet og konstantleddet i modellen.

c

Kan vi konkludere med at skjermtid forårsaker dårlegare søvn? Grunngiv.

Oppsummering

I dette kapitlet har du lært:

- Spredningsdiagram: Plott av datapunkta som viser samanhangen mellom to storleikar.
- Lineær regresjon: Å finne den rette linja y=ax+by = ax + b som passar best til datapunkta — dette gjer ein digitalt.
- Korrelasjonskoeffisienten rr: Tal mellom 1-1 og 11 som måler kor sterk den lineære samanhangen er.
- Interpolering (innanfor dataområdet) er tryggare enn ekstrapolering (utanfor).
- Korrelasjon er ikkje årsak: At to storleikar samvarierast, beviser ikkje at den eine forårsaker den andre.

Nøkkelbegrep


BegrepForklaring
RegresjonslinjeLinja som passar dataa best
KorrelasjonSamvariasjoner mellom to storleikar
InterpoleringBruke modellen innanfor datapunkta
EkstrapoleringBruke modellen utanfor datapunkta

Hugs


- rr nær 11 eller 1-1: sterk lineær samanheng. rr nær 00: svak samanheng
Repetisjonsoppgåver
Din fremgang
0deloppgaver0 / 3 oppgaver

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.