Tilbake
8.4

8.4 Ikke-lineær regresjon

En fortelling om kurver som passer bedre enn rette linjer -- polynom-, eksponential- og potensregresjon som fanger virkeligheten.

40 min
5 oppgaver
PolynomregresjonEksponentialregresjonPotensregresjonModellvalgr²-verdi
Du leser den lesevennlige versjonen
Din fremgang i kapitlet
0 / 5 oppgaver
Lytt til denne delen

Lydfil som leser opp teksten frem til første quiz.

Når den rette linjen svikter

I forrige kapittel lærte vi å dra en rett linje gjennom en sky av punkter. Men hva gjør vi når punktene tydelig ikke følger en rett linje? Hvis du plotter dataene og ser en kurve – en bue oppover, en eksponentiell stigning, eller en utflating – da er det på tide å hente frem andre verktøy.

Tenk deg at du studerer hvordan en bakteriekultur vokser over tid. De første timene er veksten moderat, men så eksploderer den. En rett linje ville bomme grovt – den ville underestimere i starten og slutten, og overestimere i midten. Residualene ville vise et tydelig buet mønster, som er et klart signal om at vi trenger en annen modell.

I dette kapittelet skal vi utforske tre typer ikke-lineær regresjon: polynomregresjon (tilpasse en andregradskurve eller lignende), eksponentialregresjon (tilpasse funksjoner på formen y=abxy = a \cdot b^x), og potensregresjon (tilpasse funksjoner på formen y=axby = a \cdot x^b). Vi skal også lære å velge mellom dem, ved hjelp av r2r^2-verdien og sunn faglig vurdering.

Residualanalyse – din beste venn

Før vi kaster oss inn i nye regresjonstyper, la oss snakke om et verktøy som hjelper oss å avgjøre om vi trenger å bytte modell: residualanalyse.

Et residual er forskjellen mellom den observerte verdien og den verdien modellen forutsier: ei=yiy^ie_i = y_i - \hat{y}_i. Når vi plotter residualene, altså legger dem inn i et diagram, kan vi lese av mye.

Dersom residualene er tilfeldig spredt rundt null – noen over, noen under, uten noe mønster – tyder det på at modellen passer godt. Dataenes variasjon er bare tilfeldig støy som ingen modell kan fange opp.

Men dersom residualene viser et systematisk mønster, for eksempel at de først er negative, deretter positive, og så negative igjen (et buet mønster), betyr det at en lineær modell ikke fanger opp krumningen i dataene. Da trenger vi en modell som er buet – kanskje en andregradsfunksjon.

Tenk på det slik: residualene er det som «er igjen» etter at modellen har gjort sitt beste. Hvis det som er igjen har et mønster, har modellen gått glipp av noe viktig. I GeoGebra kan du plotte residualene ved å beregne yif(xi)y_i - f(x_i) for hvert datapunkt, der ff er regresjonfunksjonen din.

📝Oppgave Quiz 1

Du har gjort lineær regresjon og plotter residualene. De viser et tydelig buet mønster (først negative, så positive, så negative igjen). Hva bør du gjøre?

Lytt til denne delen

Lydfil som leser opp teksten frem til neste quiz.

Polynomregresjon – buer og vendepunkter

Hvis datapunktene danner en bue – en U-form eller en omvendt U – er en andregradsfunksjon y=ax2+bx+cy = ax^2 + bx + c et naturlig valg. Og hvis kurven har et mer S-formet mønster med to vendepunkter, prøver vi en tredjegradsfunksjon y=ax3+bx2+cx+dy = ax^3 + bx^2 + cx + d.

I GeoGebra bruker vi kommandoen RegPoly(liste, grad). For en andregradstilpasning skriver du RegPoly(liste, 2), og for tredjegradstilpasning RegPoly(liste, 3).

La oss se på et eksempel. En forsker måler hastigheten til en kjemisk reaksjon ved ulike temperaturer. Dataene danner en svak bue oppover. Lineær regresjon gir y0,38x4,0y \approx 0{,}38x - 4{,}0 med r20,98r^2 \approx 0{,}98. Andregradstilpasning gir y0,0037x20,016x+0,33y \approx 0{,}0037x^2 - 0{,}016x + 0{,}33 med r20,999r^2 \approx 0{,}999.

Begge modellene har høy r2r^2, men andegradsmodellen er litt bedre og fanger opp den svake krumningen som den lineære modellen overser. Residualene fra den lineære modellen viser et lett buet mønster, mens residualene fra andegradsmodellen er tilfeldig spredt.

Her er det viktig å bruke skjønn. Hvis forskjellen i r2r^2 er minimal og den lineære modellen gir fornuftige resultater, kan den enklere modellen være å foretrekke. Men dersom du vet at den underliggende mekanismen er buet (for eksempel at reaksjonshastigheten øker akselererende med temperaturen), er andegradsmodellen et bedre faglig valg.

📝Oppgave Quiz 2

Hvilken GeoGebra-kommando bruker du for å tilpasse en andregradsfunksjon til en datamengde kalt «liste»?

Lytt til denne delen

Lydfil som leser opp teksten frem til neste quiz.

Eksponentialregresjon – bakterier, penger og forfall

Noen datasett kjennetegnes av at verdiene dobles (eller halveres) over jevne intervaller. En bakteriekultur som vokser med 50 prosent per time. En sparekonto med rentes rente. Radioaktivt materiale som halveres med jevne mellomrom. Alt dette er eksponentiell oppførsel, og vi tilpasser en funksjon på formen y=abxy = a \cdot b^x.

I GeoGebra bruker vi RegExp(liste). La oss teste det på bakteriedata: vi starter med 100 bakterier, og etter 1, 2, 3, 4, 5 og 6 timer har vi henholdsvis 150, 230, 340, 510, 760 og 1140 bakterier.

GeoGebra gir oss y1001,50ty \approx 100 \cdot 1{,}50^t. Startverdien a=100a = 100 stemmer med våre 100 bakterier ved t=0t = 0. Vekstfaktoren b=1,50b = 1{,}50 betyr at bestanden øker med 50 prosent per time.

Hva er doblingstiden? Vi løser 1,50t=21{,}50^t = 2 ved å ta logaritmen: t=ln2ln1,50=0,6930,4051,71\displaystyle t = \frac{\ln 2}{\ln 1{,}50} = \frac{0{,}693}{0{,}405} \approx 1{,}71 timer. Bakteriemengden dobles altså omtrent hver 1 time og 43 minutter.

Eksponentialregresjon fungerer også for nedgang. En metallbit som avkjøles i vann følger omtrent T800,85tT \approx 80 \cdot 0{,}85^t (temperaturen over romtemperatur). Her er b=0,85<1b = 0{,}85 < 1, som betyr at temperaturen synker med 15 prosent per minutt. Halveringstiden er ln0,5ln0,854,3\displaystyle \frac{\ln 0{,}5}{\ln 0{,}85} \approx 4{,}3 minutter. I dette tilfellet gir en eksponentialmodell r20,999r^2 \approx 0{,}999, mens en lineær modell bare gir r20,97r^2 \approx 0{,}97 – eksponentialmodellen er klart overlegen.

📝Oppgave Quiz 3

En bakteriekultur modelleres med y=1001,50ty = 100 \cdot 1{,}50^t der tt er timer. Hvor mange bakterier er det etter 2 timer?

Lytt til denne delen

Lydfil som leser opp teksten frem til neste quiz.

Potensregresjon – naturens skaleringslover

Den tredje verktøyet i verktøykassen vår er potensregresjon, som tilpasser en funksjon y=axby = a \cdot x^b. I GeoGebra bruker vi RegPot(liste).

Et fascinerende eksempel fra biologi: det finnes en sammenheng mellom kroppsmassen til et pattedyr og hjertefrekvensen. En mus (0,03 kg) har hjertefrekvens rundt 600 slag per minutt. Et menneske (70 kg) har rundt 70. En elefant (5000 kg) har bare 25. Potensregresjon gir oss f220m0,25f \approx 220 \cdot m^{-0{,}25}.

Eksponenten b0,25=14\displaystyle b \approx -0{,}25 = -\frac{1}{4} er bemerkelsesverdig. Den forteller oss at hjertefrekvensen avtar som den negative fjerde roten av kroppsmassen. Dobler vi massen, endres frekvensen med en faktor 20,250,842^{-0{,}25} \approx 0{,}84 – en reduksjon på omtrent 16 prosent. Denne sammenhengen er kjent som en del av Kleibers lov og gjelder overraskende godt for nesten alle pattedyr.

Et annet eksempel er bremsestrekninger. Data for en bil ved ulike hastigheter gir potensregresjon d0,005v2,01d \approx 0{,}005 \cdot v^{2{,}01}. Eksponenten b2b \approx 2 betyr at bremsestrekningen er tilnærmet proporsjonal med kvadratet av hastigheten. Det stemmer med fysikken: kinetisk energi er Ek=12mv2\displaystyle E_k = \frac{1}{2}mv^2, og all denne energien må bremses vekk. Dobler du farten, firedobles bremsestrekningen – en viktig påminnelse om å holde farten nede.

📝Oppgave Quiz 4

Bremsestrekningen modelleres med d=0,005v2d = 0{,}005 \cdot v^2. Hva skjer med bremsestrekningen dersom farten dobles?

Lytt til denne delen

Lydfil som leser opp teksten frem til neste quiz.

Modellvalg og faren ved overtilpasning

Nå har du fire verktøy: lineær, polynom, eksponentiell og potensregresjon. Hvordan velger du? Her er en strategi.

Først ser du på r2r^2-verdien (forklaringsgraden). Den angir hvor stor del av variasjonen i dataene som modellen forklarer. r2=1r^2 = 1 er perfekt, og vi ønsker typisk r2>0,9r^2 > 0{,}9. Men pass på: en høyere grad av polynom vil alltid gi høyere r2r^2, fordi modellen har flere parametre å leke med. Det betyr ikke at den er bedre.

Dernest gjør du en visuell vurdering. Plott dataene og regresjons-kurven. Ser det fornuftig ut? Fanger modellen opp det generelle mønsteret uten å svinge vilt mellom punktene?

Så gjør du residualanalyse. Er residualene tilfeldig spredt? Bra. Viser de et mønster? Da trenger du en annen modell.

Og til slutt – og kanskje viktigst – bruker du faglig kunnskap. Vet du at bakterier vokser prosentvis? Bruk eksponentiell. Vet du at bremsestrekning henger sammen med kinetisk energi? Bruk potens med b=2b = 2. En modell som er forankret i virkeligheten er mye mer verdt enn en som bare er statistisk tilpasset.

Et farlig feilgrep er overtilpasning. Med nok parametre kan du alltid lage en modell som går nøyaktig gjennom alle datapunktene. Et polynom av grad nn går alltid gjennom n+1n + 1 punkter. Men en slik modell fanger opp tilfeldig støy og gir elendige forutsigelser. Velg alltid den enkleste modellen som gir god tilpasning.

📝Oppgave Quiz 5

Du har 10 datapunkter og finner et tiendegradspolynom som går nøyaktig gjennom alle. Er dette en god modell?

Lytt til oppsummeringen

Lydfil som leser opp oppsummeringen.

Oppsummering

Når en rett linje ikke passer dataene, har vi tre hovedalternativer. Polynomregresjon tilpasser en andregradsfunksjon (parabel) eller høyere grad, og passer godt for data med buer eller vendepunkter. Eksponentialregresjon tilpasser y=abxy = a \cdot b^x og passer for prosentvis vekst eller nedgang – bakterier, renter, radioaktivt forfall. Potensregresjon tilpasser y=axby = a \cdot x^b og passer for fysiske skaleringslover – bremselengder, biologiske sammenhenger, planetbaner.

For å velge mellom modeller bruker vi r2r^2-verdien (jo nærmere 1, desto bedre), visuell vurdering (ser kurven fornuftig ut?), residualanalyse (er residualene tilfeldig spredt?), og faglig kunnskap (hva vet vi om fenomenet?). Vær alltid på vakt mot overtilpasning: en kompleks modell som passer perfekt til kjente data, men gir dårlige forutsigelser for nye data. Velg den enkleste modellen som gir god tilpasning.

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.