Tilbake
8.5

8.5 Modellvurdering og praktisk bruk

Sammenligne modeller, vurdere gyldighet og bruke modeller kritisk.

35 min
10 oppgaver
ModellsammenligningInterpolering vs ekstrapoleringGyldighetsområdeKritisk vurdering
Du leser den tradisjonelle versjonen
Din fremgang i kapitlet
0 / 10 oppgaver
Kapitlets plass i kurset

Samanlikne modellar

I dei førre kapitla har vi lært ulike regresjonsmetodar og funksjonstypar. I praksis må vi ofte velje mellom fleire moglege modellar for det same datasettet. Korleis veit vi kva modell som er «best»?

Det finst ikkje alltid eitt eintydig svar. Ein god modell skal:
1. Passe godt til kjende data (høg r2r^2-verdi)
2. Gi fornuftige spådommar (spesielt ved interpolering)
3. Vere basert på fagleg kunnskap (forstå mekanismen bak)
4. Vere enkel nok (ikkje unødvendig kompleks)

Punkt 4 blir kalla parsimoniprinsippet (Ockhams barberkniv): Alt anna likt, føretrekk den enklaste modellen.

Forklaringsgrad (r2r^2)
Forklaringsgraden r2r^2 (r-kvadrat) angir kor stor andel av variasjonen i dataa som blir forklart av modellen.

- r2=1r^2 = 1 (eller 100 %): Modellen forklarar all variasjon – perfekt tilpassing
- r2=0r^2 = 0 (eller 0 %): Modellen forklarar inga variasjon
- Typisk ønskjer vi r2>0,9r^2 > 0{,}9 for ein god modell

For lineær regresjon er r2r^2 kvadratet av korrelasjonskoeffisienten: r2=(Kor)2r^2 = (\text{Kor})^2.

NB: Høg r2r^2 tyder ikkje nødvendigvis at modellen er rett – han kan vere overtilpassa.

Interpolering vs. ekstrapolering: pålitelegheit

Interpolering – anslå verdiar mellom kjende datapunkt – er generelt påliteleg dersom modellen passar godt til dataa. Vi rører oss innanfor det området der modellen har blitt «trena».

Ekstrapolering – anslå verdiar utanfor dataområdet – er langt meir risikabelt. Jo lenger vi ekstrapolerer, desto meir usikkert blir resultatet. Ulike modellar kan gi svært forskjellige spådommar ved ekstrapolering, sjølv om dei passar like godt til kjende data.

Hugseregel: Bruk modellen forsiktig utanfor dataområdet, og ver alltid klar over at spådommar langt fram i tid eller utanfor kjende forhold er usikre.

✏️Døme 1 – Samanlikning av modellar

Tabellen viser gjennomsnittleg straumforbruk per husstand (yy, i kWh per år) i Noreg ved ulike år:

År200020042008201220162020
kWh21 50020 80020 20019 50019 00018 200

Lat tt vere talet på år etter 2000. Tilpass lineær og eksponentiell modell, og vurder kva som er best.

Lineær modell:
y=162t+21470y = -162t + 21\,470 med r2=0,997r^2 = 0{,}997

Eksponentiell modell:
y=215000,9917ty = 21\,500 \cdot 0{,}9917^t med r2=0,998r^2 = 0{,}998

Begge modellane passar svært godt. Den lineære modellen seier at forbruket søkk med 162 kWh per år. Den eksponentielle seier at forbruket søkk med ca. 0,83 % per år.

Vurdering:
- For kort tids ekstrapolering gir begge liknande resultat.
- Den lineære modellen gir negativt forbruk rundt t=132t = 132 (år 2132), noko som er umogleg.
- Den eksponentielle modellen nærmar seg null, men blir aldri negativ, som er meir realistisk.
- Fagleg sett er prosentvis nedgang (energieffektivisering) meir naturleg enn konstant nedgang.

Den eksponentielle modellen er truleg best for lengre framskrivingar, men begge modellane er usikre langt fram i tid.

Avgrensingar ved modellar

Alle matematiske modellar har avgrensingar. Nokre viktige å vere klar over:

1. Gyldigheitsområde: Modellen gjeld berre innanfor eit visst område av xx-verdiar. Utanfor dette kan han gi meiningslause resultat (t.d. negativt folketal).

2. Forenklingar: Modellen ser bort frå faktorar som kan vere viktige. Ein modell for fritt fall ignorerer luftmotstand, ein modell for folkeauke ignorerer krigar og epidemiar.

3. Tidsavgrensing: Ein modell som passar godt no, treng ikkje passe i framtida. Trendar kan endre seg.

4. Datatilpassing ≠ forståing: Ein modell med høg r2r^2 tyder ikkje at vi forstår mekanismen. Modellen beskriv mønsteret, men forklarar det ikkje nødvendigvis.

✏️Døme 2 – Heilskapleg analyse

Ei dyreparkavdeling har registrert talet på gjestar per år (yy, i tusen) dei siste åra:

År etter oppstart (tt)12345678
Gjestar (tusen)1528528095103108110

Analyser datasettet med ulike modellar og gi ei tilråding.

Steg 1: Visuell vurdering
Dataa viser rask vekst i byrjinga som flatar ut. Dette tyder på ei S-kurve eller ein logaritmisk/rotfunksjonsmodell.

Steg 2: Prøv ulike modellar i GeoGebra

Lineær: y14,0t+9,5y \approx 14{,}0t + 9{,}5, r20,90r^2 \approx 0{,}90
Andregradsfunksjon: y2,4t2+35,5t17,5y \approx -2{,}4t^2 + 35{,}5t - 17{,}5, r20,99r^2 \approx 0{,}99
Potensmodell: y17,8t0,92y \approx 17{,}8 \cdot t^{0{,}92}, r20,95r^2 \approx 0{,}95

Steg 3: Vurdering
- Den lineære modellen fangar ikkje opp utflatinga og gir r2=0,90r^2 = 0{,}90.
- Andregradsfunksjonen passar best med r2=0,99r^2 = 0{,}99, men han snur nedover og spår at besøkstalet søkk etter nokre år – noko som kanskje ikkje er realistisk.
- Potensmodellen med b<1b < 1 gir avtakande vekst utan å snu nedover, som er meir realistisk.

Tilråding: For interpolering og kort tids ekstrapolering er andregradsfunksjonen best. For lengre framskrivingar er potensmodellen eller ein logaritmisk modell (y=aln(t)+by = a \cdot \ln(t) + b) meir fornuftig, fordi desse ikkje spår nedgang.

Vi ser at toppunktet til andregradsfunksjonen er ved t35,522,47,4\displaystyle t \approx \frac{35{,}5}{2 \cdot 2{,}4} \approx 7{,}4, og modellen spår nedgang etter dette. Dersom vi forventar at besøkstalet stabiliserer seg (men ikkje søkk), treng vi ein annan modelltype.

Kritisk vurdering av modellar i media og forsking

Matematiske modellar blir mykje brukte i media, forsking og politikk. Det er viktig å stille kritiske spørsmål:

- Kva data byggjer modellen på? Er dataa pålitelege og representative?
- Kva funksjonstype er vald, og kvifor? Er det fagleg grunnlag for valet?
- Er det interpolering eller ekstrapolering? Spådommar langt utanfor dataa er usikre.
- Kva forenklingar er gjorde? Alle modellar forenklar verkelegheita.
- Kven har laga modellen, og med kva formål? Kan det vere skeivskapar?

Eit klassisk døme: Under pandemien blei det presentert mange modellar for smittespreiing. Ulike modellar gav svært forskjellige spådommar, avhengig av antakingar om smitterate, tiltak og åtferda til folk. Modellane var nyttige for å forstå moglege scenario, men spådommane var usikre.

📊Modellvurdering i praksis

Skriv inn eit datasett og tilpass ulike modellar. Samanlikn r2r^2-verdiane og vurder visuelt kva modell som passar best.

📝Oppgave 1

Avgjer om dei følgjande utsegnene er interpolering eller ekstrapolering:

a) Vi har temperaturdata frå kl. 08:00 til 16:00 og anslår temperaturen kl. 12:00.
b) Vi har salsdata for 2018–2023 og anslår salet i 2025.
c) Vi har data for inntekt og utdanningsnivå for personar med 8–20 års utdanning, og anslår inntekta for ein person med 15 års utdanning.
d) Vi har data for posisjonen til ein ball i dei første 3 sekunda, og reknar ut posisjonen etter 10 sekund.

📝Oppgave 2

Ei bedrift har registrert omsetning (yy, i millionar kr) over 6 år:

År (tt)123456
Omsetning2,12,53,03,64,35,2

a

Tilpass ein lineær og ein eksponentiell modell i GeoGebra.

b

Samanlikn spådommane for år 10 og år 20.

c

Kva modell ville du tilrå, og kvifor?

📝Oppgave 3

Forklar kva som er feil eller problematisk med dei følgjande påstandane:

a) «Modellen vår har r2=0,99r^2 = 0{,}99, så han er garantert rett.»
b) «Vi fann eit tiandegradspolynom som går gjennom alle 10 datapunkta, så det er den beste modellen.»
c) «Det er sterk korrelasjon mellom skoforbruk og inntekt, altså tener ein meir pengar av å kjøpe fleire sko.»

📝Oppgave 4

Ein kommune har registrert årleg vassforbruk (yy, i millionar liter) og folketal (xx, i tusen innbyggjarar) over 8 år:

Innbyggjarar (tusen)1214161922252832
Vassforbruk (mill. liter)1,82,32,93,84,85,97,29,0

a

Tilpass lineær, eksponentiell og potensmodell i GeoGebra.

b

Spå vassforbruket ved 40 000 innbyggjarar med kvar modell.

c

Kva modell er mest fornuftig frå eit fagleg synspunkt? Grunngi svaret.

d

Diskuter avgrensingane ved den valde modellen.

📝Oppgave 5

I ein avisartikkel står det: «Forsking viser at land med høgare sjokoladeforbruk per innbyggjar har fleire nobelprisvinnarar per million innbyggjarar. Korrelasjonen er sterk (r=0,79r = 0{,}79). Sjokolade gjer deg smartare!»

a) Kva er gale med denne konklusjonen?
b) Foreslå minst to moglege konfunderande variablar.
c) Beskriv korleis du ville undersøkt om det faktisk er ein kausal samanheng.

Oppsummering

I dette kapittelet har du lært å vurdere modellar kritisk:

- Forklaringsgrad r2r^2: Andelen av variasjonen i dataa som modellen forklarar (0r210 \leq r^2 \leq 1)
- Samanlikne modellar: Høgare r2r^2 er betre, men modellen må òg gi meining i situasjonen
- Interpolering vs. ekstrapolering: Spådommar innanfor dataområdet er meir pålitelege enn utanfor
- Avgrensingar: Alle modellar er forenklingar — vurder gyldigheitsområde, rimelegheit og kva som kan endre seg
- Kritisk blikk: Vurder modellar i media og forsking: Kven har laga dei, på kva datagrunnlag, og kva er usikkerheita?

Nøkkelomgrep


OmgrepForklaring
Forklaringsgrad (r2r^2)Kor mykje av variasjonen modellen forklarar
GyldigheitsområdeOmrådet der modellen er påliteleg
PrediksjonSpådom basert på modellen

Hugs


- Ein modell med r2r^2 nær 11 kan likevel gi gale spådommar utanfor dataområdet
Repetisjonsoppgåver
Din fremgang
0deloppgaver0 / 5 oppgaver

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.