Tilbake
6.5
Modellering med reelle data

6.5 Modellering med reelle data

Analysere virkelige datasett med matematikk.

60 min
19 oppgaver
Reelle dataRegresjonAnalysePresentasjon
Du leser den lesevennlige versjonen
Din fremgang i kapitlet
0 / 19 oppgaver

Når dataene er ekte

I forrige kapittel valgte vi modeller fra lærebokens ryddige verden, der bakterier dobler seg på klokkeslett. Nå åpner vi døra til virkeligheten: måleserier fra eksperimenter, statistikk fra SSB, sensordata — tall med støy, avvik og overraskelser. En kommune vil vite befolkningen i 2025. Et kraftselskap lurer på om vindturbinens effekt virkelig følger teorien. En klimaforsker stirrer på issmeltingen i Arktis. Felles for dem alle: dataene finnes, men funksjonen gjør det ikke — den må finnes, tilpasses og forsvares.

Verktøyet heter regresjon: en statistisk metode som finner funksjonen som passer datapunktene best. Men «best» i hvilken forstand? Det skal vi gjøre presist med minste kvadraters metode. Og når maskinen har spyttet ut en funksjon med imponerende mange desimaler, begynner den egentlige jobben — analytikerens fire kontrollspørsmål: Passer modellen egentlig (residualer, R2R^2)? Hvor gjelder den (interpolasjon kontra ekstrapolasjon)? Betyr sammenhengen at det ene forårsaker det andre (korrelasjon kontra kausalitet)? Og hva kan modellen fortelle oss som dataene alene ikke kan?

Det siste spørsmålet er der R2-verktøyene dine får skinne: derivasjon av modellen gir endringsrater — hvor fort vokser befolkningen ? — og integrasjon gir totale mengder — hvor mye vann rant forbi i løpet av året? En tilpasset funksjon er ikke et svar; den er et instrument. Dette kapittelet lærer deg å spille det — og å høre når det er ustemt.

Minste kvadrater og den rette linjen

Hva betyr det at en linje «passer best» til en punktsky? Minste kvadraters metode gir det presise svaret: velg funksjonen ff som minimerer summen av de kvadrerte avvikene,

S=i=1n(yif(xi))2S = \sum_{i=1}^{n} (y_i - f(x_i))^2

Hvert datapunkt måler sin vertikale avstand til kurven; avstandene kvadreres (så positive og negative avvik ikke kan utligne hverandre, og store bommerter straffes hardt) og summeres. Den ff-en i familien som gir minst sum, vinner. For lineær regresjon y=ax+by = ax + b finnes til og med eksplisitte formler for aa og bb — men i praksis lar vi digitale verktøy regne: i GeoGebra legger du dataene i lister og skriver RegLin(L1, L2) for lineær, RegExp for eksponentiell eller RegPoly(L1, L2, n) for polynom av grad nn.

Se metoden i arbeid på kommunens tall. Befolkningen (i tusen) fra 2010 til 2020 var 45,245{,}2, 47,147{,}1, 49,349{,}3, 51,051{,}0, 53,253{,}2, 55,155{,}1 — målt annethvert år. Med xx som år etter 2010 gir lineær regresjon

y=0,99x+45,2y = 0{,}99x + 45{,}2

Og her er analytikerens første plikt: tolk parametrene. Stigningstallet 0,990{,}99 betyr at byen vokser med omtrent tusen innbyggere i året; konstantleddet 45,245{,}2 er nivået i 2010. Prognosen for 2025 blir y(15)=0,9915+45,260,1y(15) = 0{,}99 \cdot 15 + 45{,}2 \approx 60{,}1 — rundt 6000060\,000 innbyggere.

Men legg merke til den lille advarselen som allerede lurer: 2025 ligger utenfor måleperioden. Anslaget hviler på at trenden fortsetter — en antakelse dataene ikke kan garantere. Det skal vi gi et navn og en grundig behandling i seksjon 3.

📝Oppgave Quiz 1

Flere familier — og faren ved å passe for godt

Ikke alle punktskyer er rette. Laboratoriets bakterietall — 10001000, 14801480, 21902190, 32403240, 47904790 med to timers mellomrom — vokser med (nesten) konstant faktor, ikke konstant tillegg: kjennetegnet for eksponentiell regresjon. GeoGebra leverer N(t)=1000e0,2tN(t) = 1000 \cdot e^{0{,}2t}, og modellen svarer på laboratoriets spørsmål: doblingstiden er ln20,23,5\displaystyle \frac{\ln 2}{0{,}2} \approx 3{,}5 timer, og etter tolv timer ventes 1000e2,4110001000e^{2{,}4} \approx 11\,000 bakterier.

Ballkast-dataene krever polynomisk regresjon: høydemålingene følger fysikkens andregradslov, og tilpasningen h(t)=4,9t2+9,8t+1,5h(t) = -4{,}9t^2 + 9{,}8t + 1{,}5 er ikke bare empiri — koeffisienten 4,9-4{,}9 er g2\displaystyle -\frac{g}{2}, gjenkjent fra mekanikk. Derivasjon gir toppen: h(t)=9,8t+9,8=0h'(t) = -9{,}8t + 9{,}8 = 0 ved t=1t = 1 s, maksimal høyde 6,46{,}4 m. Og når teorien forutsier en potenslov, tester regresjonen den: vindturbinens målinger ga P=0,55v3,02P = 0{,}55v^{3{,}02} — eksponenten 3\approx 3 bekrefter teoriens Pv3P \propto v^3 glitrende.

Men her lurer en felle med eget navn: overtilpasning. Et polynom av høy nok grad går gjennom alle datapunktene — perfekt score, elendig modell, for det er støyen den har lært, ikke trenden. En god modell er enkel nok til å generalisere. Velg lavest grad som fanger strukturen, og la gjerne fysikken stemme: andregrad for kast, tredjegrad for vindkraft.

Av og til avslører selve dataformen modellvalget. Smarttelefonandelen i Norge steg fra 30%30\% i 2010 til 95%95\% i 2020 — lineær modell ville passert 100%100\% (umulig), eksponentiell ville eksplodert. S-formen — treg start, rask midtfase, metning — roper logistisk: y=1001+e0,4(x11)\displaystyle y = \frac{100}{1 + e^{-0{,}4(x - 11)}}, med taket 100%100\% innebygd. Riktig familie først; finjustering etterpå.

📝Oppgave Quiz 2

Kontrollspørsmålene: residualer, ekstrapolasjon og kausalitet

Maskinen leverer alltid en kurve — spørsmålet er om du bør stole på den. Første kontroll: residualene, ei=yiy^ie_i = y_i - \hat{y}_i, avstandene mellom målt og modellert verdi. I en god modell er de små og tilfeldige; følger de et mønster — for eksempel en bue — har du valgt feil modellform. Befolkningsmodellen besto med glans: alle residualer under 0,150{,}15, uten mønster. Andre kontroll: bestemmelseskoeffisienten R2=1(yiy^i)2(yiyˉ)2\displaystyle R^2 = 1 - \frac{\sum (y_i - \hat{y}_i)^2}{\sum (y_i - \bar{y})^2}, andelen av variasjonen modellen forklarer — 11 er perfekt, over 0,90{,}9 er meget bra. Men husk overtilpasningen fra forrige seksjon: høy R2R^2 alene beviser ingenting.

Tredje kontroll skiller interpolasjon fra ekstrapolasjon. Innenfor måleområdet er modellen testet mot data og anslagene relativt trygge. Utenfor er den på gyngende grunn — og skrekkeksempelet er kaffekoppen: målinger de første tjue minuttene ga den utmerkede lineære modellen T=2,1t+78T = -2{,}1t + 78, men ved t=40t = 40 melder den 6°-6°C. Kaffe kaldere enn isvann, i et varmt rom. Fysikken (Newtons avkjølingslov, asymptote ved romtemperaturen) sier at den lineære modellen bare gjaldt lokalt. Samme forbehold gjelder klimaprognosen: isutbredelsen i Arktis følger A=0,095x+7,6A = -0{,}095x + 7{,}6 (R20,93R^2 \approx 0{,}93), som gir «isfritt» rundt 2060 — en grov ekstrapolasjon der tilbakekoblinger og tiltak kan endre alt. Eksterne sjokk lurer også: ingen BNP-regresjon på 2000–2019 kunne forutse pandemiåret 2020.

Fjerde kontroll er den klassiske: korrelasjon er ikke kausalitet. Iskremsalg og drukningsulykker i USA samvarierer nesten perfekt (r0,99r \approx 0{,}99) — ikke fordi iskrem drukner folk, men fordi varmt vær driver begge. En lurende tredjevariabel kan fabrikkere et hvilket som helst mønster. Modellen beskriver samvariasjonen; årsaken må argumenteres for utenfor matematikken.

📝Oppgave Quiz 3

Modellen som instrument: derivér og integrér

En validert modell er mer enn en prognosemaskin — den er en kontinuerlig funksjon, og dermed kan hele R2-verktøykassen brukes på den. Det er her kompetansemålet bor: analysere og tolke egne modeller med derivasjon og integrasjon.

Derivasjon gir endringsrater. Byen med logistisk befolkningsvekst P(t)=1001+9e0,1t\displaystyle P(t) = \frac{100}{1 + 9e^{-0{,}1t}} (i tusen, tt år etter 2000): kjerneregelen gir vekstraten

P(t)=90e0,1t(1+9e0,1t)2P'(t) = \frac{90e^{-0{,}1t}}{(1 + 9e^{-0{,}1t})^2}

— antall tusen nye innbyggere per år, som funksjon av tiden. Og når vokser byen raskest? Logistisk vekst har sin maksimale fart nøyaktig ved halve bæreevnen, P=K2=50\displaystyle P = \frac{K}{2} = 50: likningen 1+9e0,1t=21 + 9e^{-0{,}1t} = 2 gir t=ln90,122\displaystyle t = \frac{\ln 9}{0{,}1} \approx 22 — rundt år 2022 toppet veksten seg, og deretter bremser metningen den.

Integrasjon gir totale mengder. Vannføringen i en elv følger årsmodellen Q(t)=25+18sin(πt6)\displaystyle Q(t) = 25 + 18\sin\left(\frac{\pi t}{6}\right) (m³/s, tt i måneder). Den totale vannmengden gjennom året er integralet:

V=012(25+18sinπt6)dt=[25t108πcosπt6]012=300V = \int_0^{12} \left(25 + 18\sin\frac{\pi t}{6}\right) dt = \left[25t - \frac{108}{\pi}\cos\frac{\pi t}{6}\right]_0^{12} = 300

— sinusleddet integrerer seg selv bort over hele perioder, og bare middelvannføringen teller. Omregnet til kubikkmeter: rundt 7,81087{,}8 \cdot 10^8 m³, nesten en milliard kubikkmeter forbi målestasjonen på et år.

Til slutt: en modell skal presenteres etterrettelig. Oppgi datakilden, begrunn modellvalget, skriv funksjonen med parametre, dokumentér tilpasningen (R2R^2, residualer), vis graf med data og modell sammen — og angi gyldighetsområdet med usikkerheten ærlig deklarert. Det er forskjellen på tallmagi og fagarbeid.

📝Oppgave Quiz 4

Oppsummering

Virkelighetens tall fikk sin behandling. Regresjon med minste kvadraters metode — minimer (yif(xi))2\sum (y_i - f(x_i))^2 — fant funksjonen som passer best, med digitale verktøy (RegLin, RegExp, RegPoly) som regnemaskin: byens befolkning ble y=0,99x+45,2y = 0{,}99x + 45{,}2 med tusen nye innbyggere i året, bakteriene N=1000e0,2tN = 1000e^{0{,}2t} med doblingstid 3,53{,}5 timer, ballkastet 4,9t2+9,8t+1,5-4{,}9t^2 + 9{,}8t + 1{,}5 med fysikkens egen koeffisient, og vindturbinen bekreftet teoriens v3v^3-lov. Datastrukturen valgte familien — og S-formede metningsdata krevde logistisk modell, mens for høy polynomgrad ga overtilpasning: støy lært utenat.

Kontrollspørsmålene fulgte: residualene skal være små og mønsterløse, R2R^2 nær 11 tallfester forklart variasjon, interpolasjon er trygg der ekstrapolasjon er gyngende — kaffens lineære modell meldte 6°-6°C, og Arktis-prognosen for 2060 bærer alle forbehold. Og iskrem-drukning-korrelasjonen på 0,990{,}99 banket inn lærdommen: korrelasjon er ikke kausalitet.

Til slutt ble modellen instrument: derivasjon ga vekstraten og avslørte at logistisk vekst topper ved halve bæreevnen (t22t \approx 22 for byen vår), og integrasjon summerte elvens år til 300300 måned·m³/s — nesten en milliard kubikkmeter. Med en etterrettelig rapport — kilde, valg, parametre, R2R^2, gyldighetsområde — er analysen komplett.

Ett kapittel gjenstår, og det handler om fagets grunnfjell: hvordan vet vi at noe i matematikken er sant? Velkommen til beviset.

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.