Selvstendig arbeid med naturvitenskapelige data.
Frå teori til praksis
I dei førre kapitla har vi lært om eksponentiell og logistisk vekst som teoretiske modellar. No skal vi bruke desse modellane på verkelege data.
Utfordringar med reelle data:
- Data inneheld alltid noko tilfeldig variasjon (støy)
- Vi kjenner ikkje parametrane (, , osv.) på førehand
- Fleire modellar kan passe rimeleg bra
- Modellar har alltid avgrensingar
I dette kapittelet lærer vi å:
1. Velje rett modell basert på forma til dataa
2. Finne parametrar ved regresjonsanalyse
3. Vurdere kor god modellen er
4. Tolke og presentere resultata
Korleis velje modell?
Før vi tilpassar ein modell, må vi velje kva type modell som passar. Dette gjer vi ved å sjå på forma på dataa.
Lineær vekst:
- Konstant auking per tidseining
- Rett linje i vanleg diagram
- Eksempel: Fast lønstillegg kvart år
Eksponentiell vekst:
- Konstant prosentvis auking
- Kurve som blir stadig brattare
- Rett linje i semilogaritmisk diagram
- Eksempel: Rentes rente, tidleg fase av epidemi
Logistisk vekst:
- S-forma kurve
- Flatar ut mot ei øvre grense
- Eksempel: Spreiing av produkt, epidemi i befolkning
Polynomisk vekst:
- Vekst som aukar, men ikkje så raskt som eksponentiell
- Eksempel: Areal som funksjon av radius
Sjå på følgjande datasett og vurder kva modelltype som passar best:
Datasett A: Tal på brukarar av ein ny app
| Veke | 1 | 2 | 3 | 4 | 5 | 6 |
|---|---|---|---|---|---|---|
| Brukarar (tusen) | 2 | 6 | 18 | 50 | 120 | 200 |
Datasett B: Gjennomsnittleg månadstemperatur
| Månad | Jan | Feb | Mar | Apr | Mai | Jun |
|---|---|---|---|---|---|---|
| Temp (°C) | -3 | -1 | 4 | 9 | 14 | 18 |
Datasett A (App-brukarar):
- Frå veke 1-3: veksten er ca. 3x per veke (eksponentiell-liknande)
- Frå veke 4-6: veksten bremsar (50→120→200)
- Kurva ser ut til å flate ut
Konklusjon: Logistisk modell passar sannsynlegvis best. Veksten startar raskt og bremsar, typisk for spreiing av app/produkt.
Datasett B (Temperatur):
- Auking per månad: +2, +5, +5, +5, +4
- Relativt jamn auking, lineær-liknande
- Men temperaturar følgjer ofte ei sinuskurve over heile året
Konklusjon: Lineær modell for denne perioden (vår), men ein sinusmodell ville vore betre for heile året.
Regresjonsanalyse
Regresjon er ein metode for å finne den modellen som best blir tilpassa dataa. Vi bruker ofte minste kvadraters metode, som minimerer summen av kvadrerte avvik mellom data og modell.
I praksis bruker vi digitale verktøy som GeoGebra, Excel eller kalkulator til å utføre regresjon.
Tolking:
- : Perfekt tilpassing (alle punkt på kurva)
- : Modellen forklarar ingenting
- : Svært god tilpassing
- : God tilpassing
- : Svak tilpassing
1. Høg tyder ikkje at modellen er rett. Ein komplisert modell kan gi høg utan å fange den verkelege samanhengen.
2. Ekstrapolering er risikabelt. Modellen er berre påliteleg innanfor dataområdet. Å forutseie langt utanfor kan gi feil.
3. Korrelasjon er ikkje kausalitet. Sjølv om dataa passar ein modell, tyder det ikkje at x forårsakar y.
4. Sjekk residualane. Sjå om avvika er tilfeldig fordelte eller har mønster.
Eksponentiell regresjon
Når dataa ser ut til å følgje eksponentiell vekst, tilpassar vi modellen:
eller ekvivalent:
der .
Folketalet i ein by (i tusen):
| År etter 2000 | 0 | 5 | 10 | 15 | 20 |
|---|---|---|---|---|---|
| Folketal | 50 | 58 | 67 | 78 | 90 |
a) Utfør eksponentiell regresjon og finn modellen .
b) Kva er den årlege vekstraten?
c) Kva forutseier modellen for 2030?
a) Vi bruker GeoGebra eller kalkulator til eksponentiell regresjon.
Dataa gir omtrent:
(svært god tilpassing)
b) Vekstfaktoren er , som tyder:
c) For 2030 er :
OBS: Dette føreset at veksten held fram eksponentielt, noko som sjeldan skjer i praksis.
Skriv inn datapunkta som ei liste og bruk FitExp-kommandoen.
Utfør eksponentiell regresjon på datasetta.
Eit innskot over tid: År 0: 10000, År 3: 11600, År 6: 13400, År 9: 15500. Finn modellen og renta.
Bakterievekst: Time 0: 100, Time 2: 400, Time 4: 1600, Time 6: 6400. Finn modellen.
For dataa i b), finn doblingstida ved formelen .
Logistisk regresjon
Når dataa flatar ut mot ei øvre grense, bruker vi logistisk regresjon:
der er berekapasiteten (asymptoten).
Kumulativt tal på COVID-tilfelle i eit land (i tusen):
| Dag | 0 | 10 | 20 | 30 | 40 | 50 | 60 |
|---|---|---|---|---|---|---|---|
| Tilfelle | 1 | 5 | 25 | 100 | 250 | 400 | 480 |
a) Forklar kvifor logistisk modell passar.
b) Bruk regresjon til å finne modellen.
c) Estimer berekapasiteten (totalt tal på tilfelle).
a) Dataa viser typisk logistisk mønster:
- Tidleg: Rask, nesten eksponentiell vekst (1→5→25)
- Midtfase: Høg vekst (100→250)
- Seinfase: Veksten bremsar (400→480)
Kurva flatar ut, noko som tyder på at vi nærmar oss berekapasiteten.
b) Logistisk regresjon i GeoGebra (FitLogistic) gir omtrent:
c) Berekapasiteten er tusen.
Tolking: Modellen forutseier at totalt ca. 500 000 vil bli smitta i denne bølgja.
Forsiktigheit: Berekapasiteten i smittemodellar avheng av tiltak og åtferdsendringar, så han kan endre seg!
Arbeid med logistisk regresjon.
Sal av eit nytt produkt (tusen): Månad 1: 5, Månad 3: 40, Månad 6: 150, Månad 9: 280, Månad 12: 350. Tilpass logistisk modell.
For modellen i a), finn vendepunktet og maksimal salshastigheit.
Når vil 90% av berekapasiteten vere nådd?
Vurdere gyldigheita til modellen
Ein god modell skal:
1. Passe godt til dataa (høg )
2. Ha rimelege parameterverdiar
3. Gi fornuftige prediksjonar
4. Ha tilfeldig fordelte residualar
1. Overfitting: Å bruke for komplisert modell som følgjer støy i dataa.
2. Ekstrapolering: Å forutseie langt utanfor dataområdet. Ein modell som passar godt i dag, kan gi heilt feil prediksjonar for framtida.
3. Ignorere kontekst: Matematisk god tilpassing er ikkje nok. Modellen må gi meining i den verkelege situasjonen.
4. Anta konstante forhold: Vekstrater og berekapasitet kan endre seg over tid.
Ein eksponentiell modell skildrar veksten i eit selskap frå år 0 til år 10.
a) Kva forutseier modellen for år 50?
b) Diskuter kvifor denne prediksjonen sannsynlegvis er feil.
c) Kva modell ville vore meir realistisk?
a)
Modellen forutseier 117 gonger startverdi etter 50 år.
b) Problem med prediksjonen:
1. Marknadsavgrensingar: Ingen marknad er uendeleg. Etterspurnaden vil nå eit tak.
2. Konkurranse: Andre aktørar vil kome inn viss marknaden er attraktiv.
3. Ressursar: Selskapet vil møte avgrensingar i kapasitet, tilsette, kapital.
4. Historisk erfaring: Få selskap veks eksponentielt i 50 år.
c) Meir realistisk modell:
Ein logistisk modell med berekapasitet ville vore meir realistisk:
der representerer storleiken til marknaden eller den maksimale kapasiteten til selskapet.
Vurder gyldigheita til modellane.
Ein lineær modell skildrar global temperatur frå 1900 til 2000. Kva forutseier han for år 2200? Diskuter rimelegheit.
Ein logistisk modell for verdsfolketalet har milliardar. Kva faktorar kan endre ?
Eit datasett har for eksponentiell modell og for logistisk. Kva bør du velje?
Presentere og tolke resultat
Når du presenterer modellering, bør du inkludere:
1. Skildring av dataa: Kva blir målt? Kvar kjem dataa frå?
2. Grunngiving for modellval: Kvifor valde du denne modellen?
3. Modellen med parametrar: Vis formelen med tal
4. Tilpassingsmål: eller anna kvalitetsmåling
5. Tolking: Kva tyder parametrane? Kva seier modellen?
6. Avgrensingar: Når gjeld modellen? Kva kan han ikkje seie?
7. Konklusjon: Svar på spørsmålet som vart stilt
Skriv ein kort modelleringsrapport for følgjande data:
Tal på registrerte el-bilar i Noreg (tusen):
| År | 2015 | 2017 | 2019 | 2021 | 2023 |
|---|---|---|---|---|---|
| Tal | 70 | 140 | 260 | 450 | 700 |
1. Data:
Tal på registrerte el-bilar i Noreg frå 2015 til 2023. Kjelde: Statistisk sentralbyrå.
2. Modellval:
Dataa viser S-forma vekst som tyder på logistisk modell. Veksten bremsar etter kvart som marknaden nærmar seg metting.
3. Modell:
Logistisk regresjon gir:
4. Tilpassing:
(svært god)
5. Tolking:
- Berekapasitet: Ca. 1,2 millionar el-bilar
- Vekstrate: per år
- Vendepunkt: Ca. 2023, då veksten var raskast
6. Avgrensingar:
- Berekapasiteten kan endre seg med infrastruktur og politikk
- Modellen tek ikkje omsyn til økonomiske kriser eller teknologiske gjennombrot
7. Konklusjon:
El-bil-marknaden i Noreg nærmar seg metting rundt 1,2 millionar. Veksten vil halde fram, men bremse dei neste åra.
Lag ein modelleringsrapport for datasettet.
Straumeabonnentar i ei teneste (millionar): 2018: 5, 2019: 12, 2020: 30, 2021: 55, 2022: 75, 2023: 88. Vel modell og tilpass.
Forklar valet av modell og tolk parametrane.
Forutsei talet på abonnentar i 2025. Diskuter usikkerheita.
Skriv inn dine eigne datapunkt og samanlikn lineær, eksponentiell og logistisk tilpassing.
Opne modelleringsoppgåver.
Finn eit datasett på SSB.no eller ei anna kjelde. Vel data som kan modellerast med eksponentiell eller logistisk vekst.
Tilpass ein passande modell og rekn ut .
Skriv ein kort rapport (ca. 200 ord) der du tolkar resultata og diskuterer avgrensingar.
Oppsummering
Velje modell:
- Lineær: Konstant auking
- Eksponentiell: Konstant prosentvis auking
- Logistisk: S-kurve med øvre grense
Regresjonsanalyse:
- FitLine, FitExp, FitLogistic i GeoGebra
- måler tilpassingskvalitet
Kritisk vurdering:
- Høg tyder ikkje nødvendigvis god modell
- Ekstrapolering er risikabelt
- Kontekst og rimelegheit er viktig
Presentasjon:
- Skildre data og modellval
- Vis modell med parametrar og
- Tolk resultat og diskuter avgrensingar
Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.
