Tilbake
8.4

8.4 Modellering med reelle datasett

Velg modelltype, vurder kvalitet med R² og residualer, og valider mot ekte samfunnsøkonomiske data fra SSB.

70 min
15 oppgaver
ModellvalgDeterminasjonskoeffisientResidualerValideringSSB-data
Du leser den tradisjonelle versjonen
Din fremgang i kapitlet
0 / 15 oppgaver
Kapitlets plass i kurset

Fra rå data til en brukbar modell

Når du jobber med ekte samfunnsøkonomiske data, gir verktøyene (GeoGebra, Excel, Python) deg en regresjonslinje på et øyeblikk. Men det betyr ikke at modellen er god. Du må kunne velge riktig modelltype, vurdere kvaliteten og validere før du bruker den til noe.

ModellFormelNår den passer
Lineæry=ax+by = ax + bKonstant absolutt vekst per tidsenhet
Eksponentielly=abxy = a \cdot b^xKonstant prosentvis vekst (renter, befolkning)
Potensy=axby = a \cdot x^bSkalaforhold (areal/volum, produksjonsfunksjoner)
Logaritmisky=alnx+by = a \ln x + bAvtakende vekst (læring, metning, prisresponser)

Velg modelltype basert på både matematisk tilpasning og faglig forståelse. Befolkningsvekst er sjelden lineær. Boligpriser er sjelden potensfunksjoner. Hvis modellen ikke passer faglig, er den ikke god uansett R2R^2.
Determinasjonskoeffisienten R2R^2
R2=1SSresSStotR^2 = 1 - \frac{\text{SS}_{\text{res}}}{\text{SS}_{\text{tot}}}

der SSres=(yiy^i)2\text{SS}_{\text{res}} = \sum (y_i - \hat{y}_i)^2 er summen av kvadrerte residualer og SStot=(yiyˉ)2\text{SS}_{\text{tot}} = \sum (y_i - \bar{y})^2 er total variasjon.

Tolkning:
- R2=1R^2 = 1: alle punkter på kurven
- R2=0,95R^2 = 0{,}95: modellen forklarer 95 % av variasjonen
- R2<0,70R^2 < 0{,}70: vurder annen modelltype

Advarsel: Høy R2R^2 alene er ikke garanti for god modell. Sjekk alltid residualene (kapittel 7.4).

1. Plot dataene. Tegn et spredningsplott. Hvilken form har punktene?

2. Velg kandidatmodeller. Typisk 2–3 forskjellige typer som kan passe.

3. Tilpass modellene i GeoGebra/Excel/Python. Noter R2R^2 for hver.

4. Sjekk residualene for hver modell. Velg den som har høy R2R^2 og tilfeldig residualplott.

5. Vurder faglig. Gir modellen mening i konteksten? Er ekstrapolering rimelig?

6. Valider. Hvis du har nok data, hold tilbake siste 10–20 % og test prediksjonen. Hvis ikke, drøft prediksjonens usikkerhet.

✏️Eksempel 1: KPI-utvikling i Norge (SSB-data)

Konsumprisindeksen (KPI) for Norge, basisår 2015 = 100, fra SSB:

År20152017201920212023
KPI100105{,}5110{,}8117{,}9132{,}4

Velg en modell, beregn R2R^2 og diskuter.

Vi prøver to modeller (med t=t = år etter 2015):

Lineær: y^=3,9t+99,2\hat{y} = 3{,}9t + 99{,}2. Residualer: 0,8; 1,5; 1,0; 1,1; 1,00{,}8;\ -1{,}5;\ -1{,}0;\ 1{,}1;\ 1{,}0. R20,97R^2 \approx 0{,}97.

Eksponentiell: y^=99,31,036t\hat{y} = 99{,}3 \cdot 1{,}036^t. R20,99R^2 \approx 0{,}99.

Vurdering: Begge modeller har høy R2R^2, men eksponentiell er marginalt bedre. Faglig sett er prisvekst typisk prosentvis (inflasjon), så eksponentiell modell er mer rimelig.

Tolkning av eksponentiell modell: vekstfaktor 1,036 betyr ca. 3,6 % årlig prisvekst i snitt. Dette er konsistent med Norges Banks inflasjonsmål på ca. 2 %, men reflekterer den uvanlig sterke prisveksten i 2022–2023.

✏️Eksempel 2: Når lineær er feil

Tabellen viser arbeidsledighet i Norge i utvalgte år (% av arbeidsstyrken, SSB):

År20142016201820202022
Ledighet3{,}54{,}73{,}84{,}63{,}2

Kan vi modellere dette lineært?

Spredningsplottet viser ingen tydelig trend — verdier hopper opp og ned. Ledigheten varierer med konjunkturer.

Lineær regresjon (t=t = år etter 2014): y^=0,075t+4,2\hat{y} = -0{,}075t + 4{,}2. R20,03R^2 \approx 0{,}03. Modellen forklarer nesten ingen ting.

Konklusjon: Lineær modell passer ikke. Heller ikke eksponentiell eller potens vil hjelpe — dataene har ikke en monoton trend, men sykluser. Det er en grense for hva regresjon kan fange opp.

Riktig konklusjon i en rapport: «Vi finner ingen lineær trend i ledigheten i denne perioden. Ledighet henger sammen med konjunktursykluser, kriser (pandemien) og strukturelle endringer som ikke fanges av enkle regresjonsmodeller.»

Det er også et godt resultat å si at en modell ikke fungerer.

En modell tilpasset perfekt til de dataene den er bygget på, kan likevel være dårlig på nye data. Det kalles overtilpasning.

Enkel validering: Hold tilbake de siste 1–3 datapunktene. Tilpass modellen på resten. Bruk modellen til å prediktere de tilbakeholdte verdiene. Hvor langt fra bommer du?

For samfunnsøkonomiske data: Validering er spesielt viktig fordi mekanismene endrer seg. En modell tilpasset 2010–2019 trenger ikke gjelde i 2024. Ekstrapolering må diskuteres.

📝Oppgave 1

En bedrift har omsetning (mill. kr): 2018: 5,2; 2019: 5,8; 2020: 6,1; 2021: 6,9; 2022: 7,7.

a

Beregn årlig prosentvis vekst.

b

Hvilken modelltype passer best?

c

Tilpass modellen og rapporter bb.

📝Oppgave 2

Datasett: (1,200),(2,141),(4,100),(8,71),(16,50)(1, 200), (2, 141), (4, 100), (8, 71), (16, 50).

a

Beskriv mønsteret.

b

Sjekk om y=200x1/2y = 200 \cdot x^{-1/2} passer.

c

Hva er forholdet mellom yy-verdier når xx firedobles?

📝Oppgave 3

Lineær modell y^=3x+5\hat{y} = 3x + 5 er tilpasset 6 datapunkter: (1,9),(2,11),(3,14),(4,16),(5,21),(6,24)(1, 9), (2, 11), (3, 14), (4, 16), (5, 21), (6, 24).

a

Beregn residualene.

b

Beregn R2R^2 gitt yˉ=15,83\bar{y} = 15{,}83, SStot166,8\text{SS}_{\text{tot}} \approx 166{,}8.

c

Vurder modellen.

📝Oppgave 4

Tabellen viser SSB-data for konsumprisindeks for matvarer i Norge (2015 = 100):

År2018202020222024
Indeks105110121138

a

Tegn et grovt spredningsplott (med tt = år etter 2018) og foreslå modelltype.

b

Tilpass eksponentiell modell og vurder R2R^2.

c

Hvilken vekstfaktor svarer dette til, og hva betyr det?

d

Diskuter risikoen ved å ekstrapolere modellen til 2030.

📝Oppgave 5

Tabellen viser oljepris (Brent, gjennomsnitt USD/fat) i utvalgte år:

År20142016201820202022
Pris9944714299

a

Hvilken modelltype passer?

b

Beregn R2R^2 for lineær modell og kommenter.

c

Hva ville du skrive i prosjektrapporten?

📝Oppgave 6

Du ønsker å lage et reallønnsanslag. Tabellen viser gjennomsnittlig årslønn for fulltidsarbeidende i Norge (SSB, tusen kr):

År2015201820212024
Lønn528568610700
KPI (2015=100)100109119142

a

Beregn nominell lønnsvekst totalt og årlig.

b

Beregn reallønnsvekst.

c

Tilpass eksponentiell modell til reallønnen og bruk den til å predikere 2030.

d

Vurder rimeligheten faglig.

📝Oppgave 7

To modeller for samme datasett gir:

- Modell A (lineær): R2=0,95R^2 = 0{,}95, residualplott viser tydelig U-form
- Modell B (eksponentiell): R2=0,92R^2 = 0{,}92, residualer tilfeldig spredte

Velg modell og begrunn.

📝Oppgave 8

Du ønsker å modellere antall el-biler i Norge over tid (2015–2024 fra SSB):

År20152017201920212023
El-biler (tusen)75142261460754

a

Hvilke modeltyper er kandidater? Begrunn.

b

Tilpass eksponentiell modell og rapporter R2R^2.

c

Bruk modellen til å predikere 2027 og diskuter usikkerheten.

d

Hva ville en logistisk modell sagt?

📝Oppgave 9

Du har 12 datapunkter. Hvordan kan du bruke dem til å validere en modell?

📝Oppgave 10

Drøftingsoppgave: Hvorfor er det farlig å bruke regresjonsmodeller på samfunnsøkonomiske data uten å diskutere strukturelle endringer (regimeskift)?

Oppsummering

I dette kapittelet har du lært:

- Fra rådata til modell: Rens dataene, plott dem, velg modellform, tilpass med regresjon og vurder med R2R^2 og residualplott.
- Reelle datakilder: SSB, Norges Bank og andre åpne kilder gir ekte tall — KPI, boligpriser, befolkning.
- Ekstrapolering: Prediksjoner utenfor dataområdet er usikre — særlig med eksponentielle modeller.
- Uteliggere og datakvalitet: Undersøk avvikende verdier før du modellerer; medianen er mer robust enn gjennomsnittet.

Nøkkelbegreper


BegrepForklaring
RådataUbehandlede observasjoner
KPIKonsumprisindeksen (SSB)
EkstrapoleringPrediksjon utenfor dataområdet
Robust målMål som tåler uteliggere (median)

Viktige formler


- R2R^2: forklart variasjon — men sjekk alltid residualene
- Indeksregulering: ny verdi == gammel InyIgammel\displaystyle \cdot \frac{I_{ny}}{I_{gammel}}
Repetisjonsoppgaver
Din fremgang
0deloppgaver0 / 5 oppgaver

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.