UtkastBoka ble skrevet det første døgnet etter at læreplanen kom, og kvalitetssikres nå kapittel for kapittel gjennom høsten 2026. Kapitler merket «Kvalitetssikret» er gjennomgått; resten er utkast du gjerne må lese og melde fra om.
Fant du en feil, eller savner du noe i dette kapittelet?Alt leses, og feil rettes fortløpende.
Tilbake
1.1
Data, variabler og datakilder

1.1 Data, variabler og datakilder

Hva data er, kategoriske og numeriske variabler, og hvor pålitelige data kommer fra (SSB, spørreundersøkelser, målinger).

45 min
7 oppgaver
VariablerDatakilderKategoriske og numeriske data
Din fremgang i kapitlet
0 / 7 oppgaver

Statistikk begynner med et spørsmål

Statistikk starter ikke med tall. Den starter med et spørsmål vi vil ha svar på:

- Bruker elevene på skolen vår mer tid på skoleveien enn elevene på naboskolen?
- Har prisen på strøm i Sør-Norge steget mer enn i Nord-Norge de siste fem årene?
- Er det forskjell på hvor mange som fullfører videregående i by og bygd?

Fra spørsmålet går vi videre i fire trinn. Vi kaller det den statistiske
problemløsningsprosessen
:

1. Still spørsmålet — så presist at det går an å svare på det med tall.
2. Samle inn data — selv, eller fra en kilde som allerede har samlet dem.
3. Analyser data — regn ut, tegn, se etter mønster og variasjon.
4. Trekk en konklusjon — og si hvor sikker den er, og hva den ikke dekker.

Hele dette faget er en runde etter runde gjennom disse fire trinnene. I dette
første kapittelet arbeider vi med trinn 1 og 2: Hva er egentlig data? Hva slags
data finnes? Og hvor kommer de fra?

Populasjon, utvalg, enhet og variabel
Populasjonen er alle vi ønsker å si noe om. (Ordet kommer fra latin
populus, «folk», men en populasjon trenger ikke å bestå av mennesker — den kan
være alle laksefiletene på et anlegg eller alle bussavgangene i en uke.)

Enheten er én av dem vi måler på: én elev, én filet, én bussavgang.

Variabelen er egenskapen vi måler på hver enhet: reisetid, vekt, forsinkelse.

Observasjonen er den verdien variabelen får for én enhet: 2323 minutter.

Utvalget er de enhetene vi faktisk får data fra. Utvalget er altså en del av
populasjonen — vi spør 80 av 640 elever, ikke alle 640.

✏️Eksempel 1 – Skoleveien

Elevrådet ved en videregående skole med 640640 elever vil finne ut hvor lang tid
elevene bruker på skoleveien. De trekker 8080 elever tilfeldig fra elevlista og
spør hver av dem hvor mange minutter de brukte til skolen i dag.

a) Hva er populasjonen, og hva er enheten?

b) Hva er variabelen?

c) Hvor stor andel av populasjonen er med i utvalget?

Hva vet vi? Skolen har 640640 elever, og 8080 av dem er spurt.
Hva må vi finne? Populasjon, enhet, variabel og andelen 8080 av 640640.

a) Elevrådet vil si noe om alle elevene på skolen. Populasjonen er derfor de
640640 elevene. Enheten er én elev — det er på én elev om gangen vi måler.

b) Variabelen er reisetiden til skolen, målt i minutter. Én observasjon er
for eksempel 2323 minutter.

c) Andelen er utvalget delt på populasjonen:

andel=antall i utvalgetantall i populasjonen\text{andel} = \frac{\text{antall i utvalget}}{\text{antall i populasjonen}}

Vi setter inn tallene:

andel=80640=18=0,125=12,5 %\text{andel} = \frac{80}{640} = \frac{1}{8} = 0{,}125 = 12{,}5\ \%

(Føres ikke: 80640\displaystyle \frac{80}{640} forkortes med 8080 i teller og nevner.)

Svar: Populasjonen er de 640640 elevene, enheten er én elev, variabelen er
reisetiden i minutter, og utvalget utgjør 12,5 %12{,}5\ \% av populasjonen.

📝Oppgave 1

En kommune vil vite hvor mange av de 24002\,400 husstandene i kommunen som
kildesorterer matavfall. De ringer 150150 husstander som er tilfeldig trukket fra
adresseregisteret.

a

Hva er populasjonen?

b

Hva er enheten?

c

Hva er variabelen?

d

Hvor stor andel av populasjonen er med i utvalget? Svar i prosent.

Løs oppgaven

To hovedtyper variabler

Hva vi kan gjøre med data, avhenger helt av hva slags variabel vi har. Det er
derfor det aller første vi avgjør.

Kategoriske og numeriske variabler

En kategorisk variabel (også kalt kvalitativ variabel) deler enhetene inn i
grupper. Verdiene er navn, ikke mengder: reisemåte, fylke, ja/nei, karakter A–F.

- Uordnet (nominal): reisemåte, fylke. Rekkefølgen er tilfeldig.
- Ordnet (ordinal): «svært misfornøyd – misfornøyd – nøytral – fornøyd –
svært fornøyd». Her finnes det en rekkefølge, men ikke en avstand vi kan regne med.

En numerisk variabel (kvantitativ variabel) er en mengde vi kan regne med:

- Diskret: kan bare ta enkeltverdier vi kan telle — antall søsken, antall
mål i en kamp. Ingen elev har 1,41{,}4 søsken.
- Kontinuerlig: kan ta alle verdier i et intervall — høyde, tid, temperatur.
At vi skriver 2323 minutter, betyr bare at vi har rundet av.

✏️Eksempel 2 – Hvilken type er variabelen?

En idrettsklubb registrerer dette om hvert medlem. Avgjør for hver variabel om
den er kategorisk eller numerisk, og om den er uordnet/ordnet eller
diskret/kontinuerlig.

a) Medlemsnummer
b) Alder i hele år
c) Gren (fotball, håndball, friidrett)
d) Tid på 6060 meter, i sekunder
e) Treningsnivå (nybegynner, viderekommen, elite)

Vi stiller det samme spørsmålet til hver variabel: Gir det mening å regne med
verdiene?

a) Kategorisk, uordnet. Medlem 104104 er ikke «dobbelt så mye» som medlem 5252.
Medlemsnummeret er bare en merkelapp.

b) Numerisk, diskret. Alder i hele år teller vi i hele trinn.

c) Kategorisk, uordnet. Det finnes ingen naturlig rekkefølge på grenene.

d) Numerisk, kontinuerlig. Tiden 8,428{,}42 s kunne like gjerne vært
8,42378{,}4237 s — vi har bare rundet av til hundredeler.

e) Kategorisk, ordnet. Det er en rekkefølge (nybegynner kommer før elite),
men avstanden fra nybegynner til viderekommen er ikke et tall.

Svar: a) kategorisk uordnet, b) numerisk diskret, c) kategorisk uordnet,
d) numerisk kontinuerlig, e) kategorisk ordnet.

📝Oppgave 2

Avgjør for hver variabel om den er kategorisk eller numerisk, og om den
er uordnet/ordnet eller diskret/kontinuerlig. Gjør som i eksempel 2.

a

Antall personer i en husstand

b

Fylke

c

Strømforbruk i kWh en vinterdag

d

Karakter i matematikk (1–6)

e

Ventetid i minutter på legevakten

Løs oppgaven

Å systematisere data

Slik dataene kommer inn, er de rådata: en lang rekke svar i den rekkefølgen
de ble samlet inn. Rådata er vanskelige å se noe som helst i. Derfor
systematiserer vi dem — vi ordner dem slik at de kan telles og regnes på.

To regler holder orden i datamaterialet:

RegelHva den betyr
Én rad per enhetÉn elev, én rad — uansett hvor mange spørsmål eleven svarte på
Én kolonne per variabelReisetid i én kolonne, reisemåte i en annen

For kategoriske variabler teller vi opp hvor mange som havner i hver kategori.
Antallet i en kategori kaller vi frekvensen, og frekvensen delt på det
totale antallet kaller vi relativ frekvens (relativ = «sett i forhold til»).
Relativ frekvens
relativ frekvens=frekvensen i kategorienantall observasjoner\text{relativ frekvens} = \frac{\text{frekvensen i kategorien}}{\text{antall observasjoner}}

Den relative frekvensen er en andel. Ganger vi med 100 %, får vi prosentandelen. Summen av alle relative frekvenser er alltid 1.

✏️Eksempel 3 – Fra rådata til frekvenstabell

En klasse på 2020 elever ble spurt hvordan de kom seg til skolen i dag. Svarene
kom i denne rekkefølgen:

buss, gange, sykkel, gange, buss, bil, gange, sykkel, buss, gange,
sykkel, buss, gange, bil, sykkel, buss, gange, sykkel, buss, gange

Lag en frekvenstabell med frekvens og relativ frekvens i prosent.

Vi tegner først rammen til tabellen, og fyller den så ut kategori for kategori.
Vi teller opp hvor mange ganger hvert svar står i lista:

- gange: 77
- sykkel: 55
- buss: 66
- bil: 22

Kontroll før vi går videre: 7+5+6+2=207 + 5 + 6 + 2 = 20. Det stemmer med at klassen
har 2020 elever. Teller vi feil her, blir alt etterpå feil.

Så regner vi den relative frekvensen. Formelen først, tom:

relativ frekvens=frekvensantall observasjoner\text{relativ frekvens} = \frac{\text{frekvens}}{\text{antall observasjoner}}

og så med tall for gange:

720=0,35=35 %\frac{7}{20} = 0{,}35 = 35\ \%

Vi deler på 2020 fordi det er 2020 elever i klassen. På samme måte for de andre:

ReisemåteFrekvensRelativ frekvensI prosent
Gange70,3535 %
Sykkel50,2525 %
Buss60,3030 %
Bil20,1010 %
Sum201,00100 %

Svar: Tabellen over. Her ser vi at 35 %35\ \% gikk, og at bare 10 %10\ \% kom med
bil.
NB: Sumraden er ikke pynt. At de relative frekvensene summerer seg til
1,001{,}00 og prosentene til 100 %100\ \%, er kontrollen på at vi har talt riktig.
📝Oppgave 3
2525 elever ble spurt hvor mange søsken de har. Svarene kom slik:

1, 2, 0, 1, 3, 1, 2, 1, 0, 4, 2, 1, 1, 2, 0, 1, 3, 2, 1, 1, 0, 2, 1, 5, 21,\ 2,\ 0,\ 1,\ 3,\ 1,\ 2,\ 1,\ 0,\ 4,\ 2,\ 1,\ 1,\ 2,\ 0,\ 1,\ 3,\ 2,\ 1,\ 1,\ 0,\ 2,\ 1,\ 5,\ 2

Gjør den samme oppgaven som i eksempel 3.

a

Er variabelen kategorisk eller numerisk? Begrunn.

b

Lag en frekvenstabell med frekvens og relativ frekvens. Hvor mange har nøyaktig 11 søsken?

c

Hvor mange prosent har ingen søsken?

d

Hvor mange prosent har minst 22 søsken?

e

Kontroller at frekvensene dine summerer seg riktig. Hvorfor er det en kontroll verdt å gjøre?

Løs oppgaven

Hvor kommer data fra?

Vi skiller mellom to slags data:

Primærdata er data vi har samlet inn selv, til vårt eget spørsmål. Da vet vi
nøyaktig hvordan de ble til — men innsamlingen koster tid, og utvalget blir ofte
lite.

Sekundærdata er data noen andre har samlet inn, som vi henter og bruker. Da
får vi ofte store, godt kontrollerte datamaterialer gratis — men de er samlet
inn til et annet spørsmål enn vårt, og vi må selv finne ut om de passer.

Noen offentlige kilder du kan hente sekundærdata fra i Norge:

KildeHva du finner
Statistisk sentralbyrå (SSB), statistikkbankenBefolkning, inntekt, priser, utdanning, arbeid
Utdanningsdirektoratet (Udir), SkoleportenKarakterer, eksamensresultater, gjennomføring
Folkehelseinstituttet (FHI)Helse, smitte, vaksinasjon
Meteorologisk instituttTemperatur, nedbør, vind
Norges BankRente, valutakurser

Tallene lastes som regel ned som en regnearkfil, og da er de allerede
systematisert: én rad per enhet, én kolonne per variabel.
✏️Eksempel 4 – Å velge datakilde

Du skal svare på spørsmålet: Har andelen som sykler til jobb i Norge økt de
siste ti årene?
Du finner to mulige kilder:

Kilde A: En avstemning på nettsiden til et sykkelblad. 43004\,300 personer har
svart på spørsmålet «Sykler du til jobb?». 71 %71\ \% svarte ja.

Kilde B: SSBs reisevaneundersøkelse, der et tilfeldig trukket utvalg av
befolkningen intervjues om alle reisene sine en bestemt dag.

Hvilken kilde bør du bruke? Begrunn med de fem spørsmålene.

Vi går gjennom spørsmålene for hver kilde.

Kilde A:
1. Samlet inn av et sykkelblad, for å engasjere leserne.
2. Ukjent tidspunkt.
3. De som er med, har valgt seg selv — og de leser et sykkelblad. Det er et
selvselektert utvalg, ikke et tilfeldig utvalg av befolkningen.
4. Uklart hva «sykler du til jobb» betyr — hver dag? om sommeren? én gang i året?
5. 43004\,300 svar. Her ser vi at et stort antall ikke redder et skjevt utvalg:
43004\,300 sykkelinteresserte sier fortsatt ingenting om alle i Norge.

Kilde B:
1. Samlet inn av SSB, for å beskrive reisevanene i befolkningen.
2. Tidspunktet er oppgitt i undersøkelsen.
3. Tilfeldig trukket utvalg fra befolkningen.
4. Reisene registreres reise for reise en bestemt dag — definisjonen er den
samme for alle.
5. Utvalgsstørrelsen er oppgitt sammen med tallene.

Svar: Vi bruker kilde B. Kilde A svarer i beste fall på spørsmålet «hvor
mange av dem som leser sykkelblader og gidder å svare, sykler til jobb» — og
det er et annet spørsmål enn vårt.

NB: Legg merke til at kilde A hadde det største tallet og den mest presise
prosenten. Presisjon i tallet er ikke det samme som at tallet svarer på
spørsmålet vårt.

📝Oppgave 4

For hver situasjon: avgjør om det er primærdata eller sekundærdata, og nevn én
svakhet ved kilden.

a

Du teller selv antall biler som passerer skolen mellom kl. 08 og 09 en tirsdag.

b

Du laster ned kommunens folketall fra SSBs statistikkbank.

c

Du bruker karakterstatistikk fra Udir for å sammenligne to skoler.

d

Du legger ut en avstemning i klassens gruppechat om favorittidrett.

📝Oppgave 5

En nettavis skriver: «Ny undersøkelse: 71 %71\ \% av nordmenn vil ha
hjemmekontor.» I en fotnote står det at undersøkelsen ble besvart av 9696
personer som klikket seg inn fra avisens forside, og at 12001\,200 fikk se
spørsmålet.

a

Hva er svarprosenten i undersøkelsen?

b

Hvem er populasjonen avisen påstår noe om, og hvem er egentlig med i utvalget?

c

Skriv en overskrift som er dekkende for det undersøkelsen faktisk viser.

d

Hva må til for at tallet skulle kunne brukes om alle nordmenn?

Løs oppgaven

Oppsummering

I dette kapittelet har du lært:

- Statistikk starter med et spørsmål, og går videre gjennom innsamling,
analyse og konklusjon.
- Populasjon er alle vi vil si noe om, utvalget er de vi får data fra,
enheten er én av dem, og variabelen er det vi måler.
- Kategoriske variabler deler i grupper (uordnet eller ordnet).
Numeriske variabler er mengder vi kan regne med (diskrete eller kontinuerlige).
- Å systematisere data: én rad per enhet, én kolonne per variabel, og
frekvenstabell for kategoriske og diskrete variabler.
- Relativ frekvens == frekvens delt på antall observasjoner. Summen er alltid 11.
- Primærdata samler vi inn selv, sekundærdata henter vi fra kilder som
SSB, Udir, FHI og Meteorologisk institutt.
- Fem spørsmål til kilden: hvem, når, hvem er med, hvordan målt, hvor mange.

Husk


- Store tall redder ikke et skjevt utvalg.
- Kontroller alltid at frekvensene summerer seg til antall observasjoner.
📝Oppgave 6
Del 2 (digitale verktøy). 3030 elever oppga hvor mange timer de brukte på
skjerm i går. Svarene (i timer) var:

2,03,51,54,02,53,05,02,03,54,52{,}0\quad 3{,}5\quad 1{,}5\quad 4{,}0\quad 2{,}5\quad 3{,}0\quad 5{,}0\quad 2{,}0\quad 3{,}5\quad 4{,}5
1,02,53,03,52,06,02,53,04,01,51{,}0\quad 2{,}5\quad 3{,}0\quad 3{,}5\quad 2{,}0\quad 6{,}0\quad 2{,}5\quad 3{,}0\quad 4{,}0\quad 1{,}5
2,03,52,54,53,02,05,53,02,53,52{,}0\quad 3{,}5\quad 2{,}5\quad 4{,}5\quad 3{,}0\quad 2{,}0\quad 5{,}5\quad 3{,}0\quad 2{,}5\quad 3{,}5

Legg tallene inn i ett regneark, i kolonne A, med overskrift i celle $A$1.

a

Er variabelen diskret eller kontinuerlig? Begrunn.

b

Del dataene i klassene [1,2[1, 2\rangle, [2,3[2, 3\rangle, [3,4[3, 4\rangle, [4,5[4, 5\rangle og [5,6,5[5, 6{,}5\rangle, og finn frekvensen i hver klasse. Bruk =ANTALL.HVIS.SETT(...) eller =FREKVENS(...).

c

Finn den relative frekvensen i hver klasse, i prosent med én desimal.

d

Hvor mange prosent brukte minst 44 timer?

e

Klassen vil bruke resultatet i en sak i skoleavisa med overskriften «Elevene ved skolen bruker mye tid på skjerm». Drøft om overskriften er dekkende.

Løs oppgaven
📝Oppgave 7
Drøftingsoppgave. To elever skal undersøke om ungdom i kommunen trener nok.

- Ida deler et spørreskjema i sosiale medier og får 850850 svar.
- Jonas trekker 120120 ungdommer tilfeldig fra kommunens innbyggerregister og
ringer alle. 9494 svarer.

a

Hvem har størst utvalg, og hvem har best utvalg? Begrunn forskjellen.

b

Regn ut svarprosenten til Jonas.

c

Hvorfor kan vi ikke regne ut noen svarprosent for Ida?

d

Spørsmålet «Trener du nok?» er dårlig formulert. Skriv om det slik at variabelen blir numerisk, og si hvilken type variabel du da får.

e

Hva ville du gjort hvis du fikk bruke én time og ett regneark på undersøkelsen? Begrunn valgene dine.

Løs oppgaven

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.