UtkastBoka ble skrevet det første døgnet etter at læreplanen kom, og kvalitetssikres nå kapittel for kapittel gjennom høsten 2026. Kapitler merket «Kvalitetssikret» er gjennomgått; resten er utkast du gjerne må lese og melde fra om.
Fant du en feil, eller savner du noe i dette kapittelet?Alt leses, og feil rettes fortløpende.
Tilbake
8.2
Gjennomføring, analyse og presentasjon

8.2 Gjennomføring, analyse og presentasjon

Å analysere reelle data, vurdere gyldighet og presentere funnene.

45 min
7 oppgaver
AnalysePresentasjonGyldighet
Din fremgang i kapitlet
0 / 7 oppgaver

Når planen møter virkeligheten

I kapittel 8.1 Problemstilling og plan skrev elevrådet ved Fjordbyen
videregående skole en plan i åtte punkter. Problemstillingen var:

Er gjennomsnittlig skjermtid på telefonen en vanlig skoledag høyere enn
200200 minutter blant elevene på VG2 ved skolen?

De trakk 4040 elever tilfeldig fra VG2-lista på 184184, og 3636 svarte. Nå har
de en fil med tall.

Dette kapittelet følger den samme undersøkelsen gjennom de tre siste trinnene i
arbeidssyklusen: data, analyse og presentasjon. Underveis bruker vi
metoder fra nesten hvert eneste kapittel i boka. Det er meningen — det er her
faget settes sammen.

Én ting skal du vite på forhånd: ingen datainnsamling går helt etter planen.
Noen svarer ikke. Noen svarer «ca 3 timer» i en kolonne der det skal stå et
tall. Én skriver 14401\,440, som er hele døgnet. Det er normalt, og det er
håndterbart — så lenge du dokumenterer hva du gjorde.

Datarydding og dataloggen
Datarydding er arbeidet med å gjøre rådataene klare for analyse: rette
åpenbare skrivefeil, håndtere manglende svar og gjøre alle verdier om til
samme format og samme enhet.

Dataloggen er en liste over alt du gjorde under ryddingen, med begrunnelse:

RadHva som stoHva vi gjordeHvorfor
12«ca 3 timer»180180Eneste rimelige tolkning; avrundet som de andre
19(tomt)Tatt utIngen verdi å tolke
2714401\,440Tatt utHele døgnet — umulig som skjermtid på telefon

Dataloggen er ikke ryddearbeid du gjør for deg selv. Den er en del av
rapporten
. Uten den kan ingen etterprøve analysen, og du kan ikke skille
mellom en verdi du fjernet fordi den var umulig, og en du fjernet fordi du
ikke likte den.
✏️Eksempel 1 – Rydding av rådatafila

De første radene i elevrådets fil ser slik ut. Kolonne B er skjermtid i
minutter, kolonne C er søvn i timer.

RadSkjermtidSøvn
22408
31856,5
4ca 4 timer6,5
52207
6(tomt)(tomt)
714407
83307

Rydd fila, og skriv dataloggen.

Vi går rad for rad, og spør hver gang: er verdien umulig, eller bare uvanlig?

Rad 4 — «ca 4 timer». Verdien finnes, men er i feil format. 44 timer er
460=2404 \cdot 60 = 240 minutter. Vi gjør den om og noterer det. Alternativet — å
kaste raden — ville fjernet informasjon vi faktisk har.

Rad 6 — tomt. Eleven svarte ikke. Her finnes ingen verdi å tolke, og raden
tas ut. Den teller som frafall, ikke som nedsatt datakvalitet, og skal med
i svarprosenten.

Rad 7 — 14401\,440. Et døgn har 2460=144024 \cdot 60 = 1\,440 minutter. Verdien er
altså hele døgnet, søvnen inkludert, og er umulig som skjermtid. Vi tar den
ut, og noterer at vi mistenker at eleven leste av feil tall i loggen.

Rad 8 — 330330. Dette er den høyeste ekte verdien i materialet, men 5,55{,}5
timer på telefonen er fullt mulig. Vi beholder den. (Vi kontrollerer senere om
den er en uteligger etter regelen i kapittel 1.5 — det er den ikke.)

Dataloggen:

RadHva som stoHva vi gjordeHvorfor
4«ca 4 timer»240240Omregnet til minutter, samme enhet som de andre
6tomtRaden tatt utIngen verdi; telles som frafall
714401\,440Raden tatt utHele døgnet — umulig verdi

Svar: Rad 4 gjøres om til 240240, rad 6 og 7 tas ut, rad 8 beholdes. Etter
ryddingen står det 3636 brukbare svar igjen av 4040 trukne, altså en
svarprosent på
3640=0,90=90 %\frac{36}{40} = 0{,}90 = 90\ \%
📝Oppgave 1
En klasse har samlet inn hvor mange minutter hver elev brukte på skolevegen.
Fila inneholder disse verdiene:

18,25,under 10,32,0,14,5,47,(tomt),2118, \quad 25, \quad \text{under 10}, \quad 32, \quad 0, \quad 14, \quad -5, \quad 47, \quad \text{(tomt)}, \quad 21

Eleven som skrev 00, bor i nabobygget til skolen.

a

Hvilke verdier er umulige og skal ut?

b

Hva gjør du med 00?

c

Hva gjør du med «under 10» og med den tomme cellen?

d

Hvor mange verdier står igjen, og hva er gjennomsnittet av dem?

e

Skriv dataloggen for de tre radene du endret eller fjernet.

Løs oppgaven

Analysetrappa

Når dataene er ryddet, er fristelsen å kaste alt du kan av statistikk på dem.
Ikke gjør det. Analysen skal svare på problemstillingen, og ingenting
annet. En rapport med ti diagrammer som ikke svarer på spørsmålet, er svakere
enn en rapport med to som gjør det.

Analysen har tre trinn, og du går bare så langt opp som problemstillingen
krever:

TrinnHva du gjørVerktøyKapittel
1. BeskrivHvordan ser materialet ut?xˉ\bar{x}, ss, median, kvartiler, histogram, boksplott1.2–1.5
2. Sammenlign eller se sammenhengEr gruppene forskjellige? Følger de to variablene hverandre?Boksplott side ved side, spredningsplott, rr, regresjonslinje1.5, 2.1–2.3
3. GeneraliserHva tør vi si om hele populasjonen?Konfidensintervall, hypotesetest7.1–7.7

Trinn 1 hopper du aldri over. Det er der du oppdager skrivefeilen du ikke fant
i ryddingen, og det er der du ser om materialet i det hele tatt ser ut slik
metodene i trinn 3 forutsetter.
✏️Eksempel 2 – Beskrivende analyse av skjermtiden
De 3636 svarene, sortert (minutter):

125130135135145150155165175125 \quad 130 \quad 135 \quad 135 \quad 145 \quad 150 \quad 155 \quad 165 \quad 175
180180185190210210220220225180 \quad 180 \quad 185 \quad 190 \quad 210 \quad 210 \quad 220 \quad 220 \quad 225
230235235240240250250250255230 \quad 235 \quad 235 \quad 240 \quad 240 \quad 250 \quad 250 \quad 250 \quad 255
255260265275275275310325330255 \quad 260 \quad 265 \quad 275 \quad 275 \quad 275 \quad 310 \quad 325 \quad 330

a) Regn ut xˉ\bar{x} og ss.

b) Finn femtallssammendraget, og undersøk om materialet har uteliggere.

c) Lag et histogram med klassebredde 5050 minutter, og beskriv formen.

a) Hva vet vi? n=36n = 36 målinger. Hva må vi finne? Gjennomsnitt og
standardavvik.

Gjennomsnittet er summen delt på antallet:

xˉ=1nxi\bar{x} = \frac{1}{n}\sum x_i

Summen av alle 3636 verdiene er 78907\,890, så

xˉ=789036=219,16219,2 minutter\bar{x} = \frac{7\,890}{36} = 219{,}1\overline{6} \approx 219{,}2 \text{ minutter}

Det er 33 timer og 3939 minutter.

For spredningen bruker vi utvalgsstandardavviket ss, altså den som deler
n1n - 1. Grunnen står i kapittel 5.7: de 3636 elevene er et utvalg som skal
si noe om alle 184184, og da underestimerer nn-versjonen spredningen i
populasjonen.

s=1n1(xixˉ)2s = \sqrt{\frac{1}{n-1}\sum (x_i - \bar{x})^2}

I regneark: =STDAV.S(B2:B37). Det gir

s55,4 minutters \approx 55{,}4 \text{ minutter}

(Føres ikke: hele summen (xixˉ)2=107325\sum (x_i - \bar{x})^2 = 107\,325 regnes av
regnearket.)

b) Femtallssammendraget (kapittel 1.5). Med n=36n = 36 er medianen snittet av
den 18.18. og den 19.19. verdien:

median=225+2302=227,5\text{median} = \frac{225 + 230}{2} = 227{,}5

Nedre kvartil er medianen i de 1818 laveste, altså snittet av den 9.9. og
10.10.:

Q1=175+1802=177,5Q_1 = \frac{175 + 180}{2} = 177{,}5

Øvre kvartil er medianen i de 1818 høyeste, altså snittet av den 27.27. og
28.28.:

Q3=255+2552=255Q_3 = \frac{255 + 255}{2} = 255

Femtallssammendraget er 125125177,5177{,}5227,5227{,}5255255330330.

Uteliggergrensene fra kapittel 1.5:

Q3Q1=255177,5=77,5Q_3 - Q_1 = 255 - 177{,}5 = 77{,}5

Q3+1,577,5=255+116,25=371,25Q_3 + 1{,}5 \cdot 77{,}5 = 255 + 116{,}25 = 371{,}25

Q11,577,5=177,5116,25=61,25Q_1 - 1{,}5 \cdot 77{,}5 = 177{,}5 - 116{,}25 = 61{,}25

Største verdi er 330330, minste er 125125. Begge ligger godt innenfor. Ingen
uteliggere
— og dermed ingen verdi vi trenger å diskutere om skal være med.

Et boksplott over en vannrett akse merket skjermtid i minutter, med tallene 50 til 400. Raden er merket 36 elever. Den blå boksen går fra 177,5 til 255 med en tykk svart loddrett strek i 227,5 — medianen — og en rød rombe i 219,2, som er gjennomsnittet. Værhårene går ut til 125 til venstre og 330 til høyre, med en kort loddrett strek i hver ende. Under boksplottet ligger de 36 målingene som små grå prikker langs aksen. Flere elever har nøyaktig samme skjermtid — 250 og 275 minutter går igjen tre ganger hver, og seks andre verdier to ganger — så det er 25 prikker å se, ikke 36. Ingen måling er tegnet som åpen ring, altså er ingen av dem uteligger.

Femtallssammendraget som bilde: 125 — 177,5 — 227,5 — 255 — 330. Boksen rommer de midterste 50 % av elevene, og Q3Q1=77,5Q_3 - Q_1 = 77{,}5 minutter. Uteliggergrensene Q11,5IQR=61,25Q_1 - 1{,}5 \cdot \text{IQR} = 61{,}25 og Q3+1,5IQR=371,25Q_3 + 1{,}5 \cdot \text{IQR} = 371{,}25 ligger utenfor alle målingene, så materialet har ingen uteliggere. Den røde romben er gjennomsnittet 219,2 — det ligger til venstre for medianen, som i en venstreskjev fordeling.

c) Vi teller opp i klasser med bredde 5050:

Klasse (min)[100,150[100, 150\rangle[150,200[150, 200\rangle[200,250[200, 250\rangle[250,300[250, 300\rangle[300,350[300, 350\rangleSum
Antall581010336

Kontroll: 5+8+10+10+3=365 + 8 + 10 + 10 + 3 = 36. Det stemmer.
Formen: fordelingen er tilnærmet symmetrisk, med tyngdepunktet i

midten. Klassene er 5,8,10,10,35, 8, 10, 10, 3, og det er nøyaktig like langt fra

medianen ut til hver ytterverdi: 330227,5=102,5330 - 227{,}5 = 102{,}5 og
227,5125=102,5227{,}5 - 125 = 102{,}5. Venstresiden er likevel litt tyngre enn høyresiden:
gjennomsnittet (219,2219{,}2) ligger omtrent 88 minutter under medianen
(227,5227{,}5), fordi det er flere lave verdier enn høye.
Et histogram med fem blå søyler. Den vannrette aksen viser skjermtid i minutter fra 0 til 400, den loddrette antall elever fra 0 til 12. Søylene dekker området fra 100 til 350 minutter. Søylen over 100 til 150 har høyden 5, søylen over 150 til 200 har høyden 8, søylene over 200 til 250 og 250 til 300 har begge høyden 10, og søylen over 300 til 350 har høyden 3. Høyden står skrevet over hver søyle.
Skjermtid på en skoledag for de 36 elevene som svarte, i klasser på 50 minutter. Tyngdepunktet ligger mellom 200 og 300 minutter, og fordelingen er nesten symmetrisk, med et lite overskudd mot venstre: gjennomsnittet 219,2 ligger litt lavere enn medianen 227,5.

Svar: a) xˉ219,2\bar{x} \approx 219{,}2 minutter og s55,4s \approx 55{,}4

minutter; b) 125125177,5177{,}5227,5227{,}5255255330330, ingen uteliggere;

c) 5,8,10,10,35, 8, 10, 10, 3 — en tilnærmet symmetrisk fordeling uten uteliggere.

📝Oppgave 2
Regneark. En klasse ved en annen skole gjorde den samme undersøkelsen og
fikk 2020 svar (minutter):

150165170180185190195200205210150 \quad 165 \quad 170 \quad 180 \quad 185 \quad 190 \quad 195 \quad 200 \quad 205 \quad 210
215220225230240245260275290350215 \quad 220 \quad 225 \quad 230 \quad 240 \quad 245 \quad 260 \quad 275 \quad 290 \quad 350

Gjør den samme beskrivende analysen som i eksempel 2.

a

Regn ut xˉ\bar{x} og ss. Bruk =GJENNOMSNITT(...) og =STDAV.S(...). Rund av til én desimal.

b

Finn femtallssammendraget.

c

Undersøk om 350350 er en uteligger etter regelen i kapittel 1.5.

d

Skal 350350 fjernes? Begrunn, og regn ut hva xˉ\bar{x} blir hvis du fjerner den.

e

Sammenlign de to skolene. Hvilke to tall vil du sette opp mot hverandre, og hva kan du ikke konkludere med?

Løs oppgaven

Fra utvalget til populasjonen

Så langt har vi bare beskrevet de 3636 elevene som svarte. Problemstillingen
handler om alle 184184. Skrittet fra de 3636 til de 184184 er nettopp det
kapittel 7 handler om, og det består av to deler:

- Konfidensintervallet sier hvor μ\mu trolig ligger.
- Hypotesetesten sier om materialet er sterkt nok til å forkaste påstanden
om at μ=200\mu = 200.

De to henger sammen, og det er nyttig å se dem side om side før du regner:
ligger 200200 utenfor det 95 %95\ \% konfidensintervallet, vil den tosidige
testen forkaste på 5 %5\ \%-nivå.

✏️Eksempel 3 – Konfidensintervall og hypotesetest

For de 3636 svarene er xˉ=219,16\bar{x} = 219{,}1\overline{6} minutter og
s55,4s \approx 55{,}4 minutter.

a) Regn ut et 95 %95\ \% konfidensintervall for μ\mu.

b) Test H0H_0: μ=200\mu = 200 mot H1H_1: μ>200\mu > 2005 %5\ \% signifikansnivå.

c) Ville konklusjonen blitt den samme på 1 %1\ \%-nivå?

Hva vet vi? n=36n = 36, xˉ=219,16\bar{x} = 219{,}1\overline{6}, s=55,4s = 55{,}4.
Hva må vi finne? Intervall, testkonklusjon — og hvor følsom konklusjonen er
for signifikansnivået.

Vi begynner med standardfeilen, som begge delene bygger på:

sn=55,436=55,469,23\frac{s}{\sqrt{n}} = \frac{55{,}4}{\sqrt{36}} = \frac{55{,}4}{6} \approx 9{,}23

a) Formelen for konfidensintervallet (kapittel 7.2), først tom:

xˉ±1,96sn\bar{x} \pm 1{,}96 \cdot \frac{s}{\sqrt{n}}

og så med tall:

219,17±1,969,23219{,}17 \pm 1{,}96 \cdot 9{,}23

219,17±18,09219{,}17 \pm 18{,}09

Intervallet blir

[201,1 ; 237,3][\,201{,}1 \ ;\ 237{,}3\,]

Vi er altså 95 %95\ \% sikre på at gjennomsnittlig skjermtid blant alle de
184184 VG2-elevene ligger mellom 201201 og 237237 minutter.

Legg merke til bredden: intervallet er 3636 minutter bredt. Undersøkelsen kan
ikke skille 210210 fra 230230 minutter. Det var akkurat det feilmarginregningen
i kapittel 8.1 eksempel 4 forutsa — der kom vi fram til omtrent 1717 minutter
hver vei.

b) Hypotesene:

H0:μ=200H1:μ>200H_0: \mu = 200 \qquad H_1: \mu > 200

Testen er ensidig fordi problemstillingen spør om skjermtiden er høyere
enn i fjor, ikke om den er forskjellig fra i fjor.

Testobservatoren (kapittel 7.5), først tom:

z=xˉμ0snz = \frac{\bar{x} - \mu_0}{\frac{s}{\sqrt{n}}}

og med tall:

z=219,172009,23=19,179,232,08z = \frac{219{,}17 - 200}{9{,}23} = \frac{19{,}17}{9{,}23} \approx 2{,}08

Den kritiske verdien for en ensidig test på 5 %5\ \%-nivå er 1,6451{,}645. Siden

2,08>1,6452{,}08 > 1{,}645

forkaster vi H0H_0.

pp-verdien er sannsynligheten for å få et gjennomsnitt minst så høyt som vårt,
dersom H0H_0 er sann:

p=P(Z2,08)0,019p = P(Z \geq 2{,}08) \approx 0{,}019

c) På 1 %1\ \%-nivå er den kritiske verdien 2,3262{,}326. Nå er

2,08<2,3262{,}08 < 2{,}326

og vi forkaster ikke. Det samme ser vi på pp-verdien: 0,019>0,010{,}019 > 0{,}01.

Dette er verdt å stoppe ved. Det samme datamaterialet gir «forkast» på
5 %5\ \%-nivå og «forkast ikke» på 1 %1\ \%-nivå. Konklusjonen er altså ikke
solid — den er akkurat på riktig side av grensen vi valgte på forhånd. En
ærlig rapport skriver det, i stedet for bare å skrive «signifikant».

Et vannrett blått linjestykke med endestreker over en akse merket skjermtid i minutter, med tallene 195 til 245. Den loddrette aksen har én rad, merket 95 prosent KI. Linjestykket går fra 201,1 til 237,3 og har et svart punkt i 219,2, merket x med strek over er lik 219,2. En rød loddrett strek står i 200, like til venstre for linjestykkets venstre ende, merket H0 kolon my er lik 200. Under står teksten bare 1,1 minutt fra grensen.

At 200 ligger utenfor intervallet, er den samme opplysningen som at testen forkaster H0H_0. Men marginen er 1,1 minutt på et intervall som er 36 minutter bredt. Konklusjonen er altså riktig — og tynn. Det er verdt å skrive i rapporten, ikke bare ordet «signifikant».

Svar: a) [201,1 ; 237,3][\,201{,}1 \ ;\ 237{,}3\,] minutter; b) z2,08>1,645z \approx 2{,}08 > 1{,}645, p0,019p \approx 0{,}019, så H0H_0 forkastes på 5 %5\ \%-nivå;
c) nei — på 1 %1\ \%-nivå forkastes ikke H0H_0.

📝Oppgave 3

En kommune har målt ventetiden på legevakten for et tilfeldig utvalg på
n=49n = 49 pasienter. Utvalget ga xˉ=47,2\bar{x} = 47{,}2 minutter og
s=14,0s = 14{,}0 minutter. Kommunen har lovet at gjennomsnittlig ventetid ikke
overstiger 4545 minutter.

a

Regn ut standardfeilen sn\displaystyle \frac{s}{\sqrt{n}}.

b

Regn ut et 95 %95\ \% konfidensintervall for μ\mu.

c

Sett opp hypotesene, og avgjør om testen skal være ensidig eller tosidig.

d

Regn ut zz og avgjør på 5 %5\ \%-nivå.

e

En avis skriver: «Målingen viser at kommunen holder løftet sitt.» Er det en dekkende tolkning? Begrunn.

Løs oppgaven

Sammenhengen mellom to variabler

Elevrådet spurte også om søvn natten etter. Da har de to tall for hver elev, og
kan undersøke tilleggsspørsmålet fra planen:

Er det en sammenheng mellom skjermtiden på skoledagen og antall timer søvn
natten etter?

Framgangsmåten er den fra kapittel 2.1–2.3, i tre skritt:

1. Tegn spredningsplottet først. Alltid. Korrelasjonskoeffisienten alene
kan ikke skille en rett sammenheng fra en krum, og et tall skjuler en
uteligger som et plott viser med én gang.
2. Regn korrelasjonskoeffisienten rr, og tolk styrken og retningen.
3. Finn regresjonslinja hvis sammenhengen ser lineær ut — og bare da.

Til slutt kommer det viktigste skrittet, som ikke er regning i det hele tatt:
å si hva sammenhengen ikke betyr.

✏️Eksempel 4 – Søvn mot skjermtid

For de samme 3636 elevene er

StørrelseSkjermtid xx (min)Søvn yy (timer)
Gjennomsnittxˉ=219,17\bar{x} = 219{,}17yˉ=7,08\bar{y} = 7{,}08
Standardavviksx=55,38s_x = 55{,}38sy=0,69s_y = 0{,}69

Korrelasjonskoeffisienten er r=0,55r = -0{,}55.
a) Tolk rr.
b) Finn regresjonslinja.

c) Hvor mye mindre søvn svarer linja til når skjermtiden øker med 100100

minutter?

d) Hvor stor andel av variasjonen i søvn henger sammen med skjermtid?

e) Kan elevrådet skrive at skjermtid gir dårligere søvn?

a) r=0,55r = -0{,}55 er negativ, så høy skjermtid følges av lite søvn i dette
materialet. Tallverdien 0,550{,}55 er en middels sterk sammenheng (kapittel
2.2): punktene følger en fallende retning, men med tydelig spredning rundt
den.

b) Stigningstallet til regresjonslinja (kapittel 2.3), først tomt:

b=rsysxb = r \cdot \frac{s_y}{s_x}

og med tall:

b=0,550,6955,38=0,0068527b = -0{,}55 \cdot \frac{0{,}69}{55{,}38} = -0{,}0068527

Konstantleddet finner vi av at linja går gjennom (xˉ,yˉ)(\bar{x}, \bar{y}):

a=yˉbxˉa = \bar{y} - b \cdot \bar{x}

a=7,08(0,0068527)219,17=7,08+1,5019=8,5819a = 7{,}08 - (-0{,}0068527) \cdot 219{,}17 = 7{,}08 + 1{,}5019 = 8{,}5819

Linja blir

y=0,0068x+8,58y = -0{,}0068x + 8{,}58

(Føres ikke: vi har regnet videre på de avrundede tallene i tabellen over.
Regner regnearket i stedet direkte på de 3636 tallparene, får det
b=0,006825b = -0{,}006825 og a=8,5792a = 8{,}5792. Forskjellen sitter i fjerde gjeldende
siffer og skyldes bare avrundingen i tabellen — linja blir den samme.
Konstantleddet må derimot regnes med uavrundet bb: setter du inn 0,0068-0{,}0068,
får du 8,578{,}57, og linja går ikke lenger gjennom (xˉ,yˉ)(\bar{x}, \bar{y}).)

Et spredningsplott med de 36 målingene. To par faller helt sammen, så bare 34 blå prikker er synlige. Den vannrette aksen viser skjermtid i minutter med tallene 80 til 320, den loddrette viser søvn i timer fra 5 til 9,5 med et markert brudd nederst på aksen. Punktene ligger spredt mellom 125 og 330 minutter og mellom 6 og 8,5 timer. Elevene med lavest skjermtid ligger stort sett på 7 timer eller mer, mens elevene med høyest skjermtid stort sett ligger på 7 timer eller mindre. En rød rett linje går gjennom punktskyen og faller fra omtrent 7,8 timer ved 110 minutter til omtrent 6,2 timer ved 345 minutter. Ligningen y er lik minus 0,0068x pluss 8,58 står skrevet nede til venstre.

Søvn mot skjermtid for de 36 elevene, med regresjonslinja. Den loddrette aksen har et markert brudd, slik kapittel 1.6 krever av en innzooming. Spredningen rundt linja er stor — r = −0,55.

c) Stigningstallet forteller hvor mye yy endrer seg når xx øker med 11. Vi
ganger med 100100:

100(0,0068)=0,68100 \cdot (-0{,}0068) = -0{,}68

Linja svarer til omtrent 0,680{,}68 timer mindre søvn, altså rundt 4141 minutter,
per 100100 minutter mer skjermtid.

d) Andelen er r2r^2 (kapittel 2.3):

r2=(0,55)2=0,30=30 %r^2 = (-0{,}55)^2 = 0{,}30 = 30\ \%

Omtrent 30 %30\ \% av variasjonen i søvn henger sammen med skjermtiden. De
resterende 70 %70\ \% skyldes alt annet: trening, jobb, lekser, bekymringer,
hvor langt eleven har til skolen.

e) Nei. Dette er kjernen i kapittel 2.4. Materialet er observert, ikke
framkalt: ingen ble tildelt mye eller lite skjermtid. Minst tre forklaringer
passer like godt til de samme punktene:

- Skjermtid går ut over søvnen.
- Den som sover dårlig, ligger våken med telefonen — årsaken går andre
veien
.
- En tredje faktor, for eksempel kveldsjobb eller stress, gir både mer
skjermtid og mindre søvn.

Skal årsak avgjøres, trengs et forsøk der skjermtiden faktisk tildeles
tilfeldig — og det er noe annet enn en spørreundersøkelse.

Svar: a) middels sterk negativ sammenheng; b) y=0,0068x+8,58y = -0{,}0068x + 8{,}58;
c) omtrent 0,680{,}68 timer, altså rundt 4141 minutter; d) omtrent 30 %30\ \%;
e) nei — sammenheng er ikke årsak.

📝Oppgave 4

En iskiosk har registrert temperatur og antall solgte softis på 3030 dager.
Materialet oppsummeres slik:

StørrelseTemperatur xx (°C)Solgte softis yy
Gjennomsnittxˉ=12,0\bar{x} = 12{,}0yˉ=84\bar{y} = 84
Standardavviksx=5,0s_x = 5{,}0sy=30s_y = 30

Korrelasjonskoeffisienten er r=0,80r = 0{,}80.

a

Tolk rr med ord.

b

Finn stigningstallet til regresjonslinja.

c

Finn hele linja.

d

Hvor mange softis svarer linja til på en dag med 20 20\ ^\circC?

e

Kiosken vil bruke linja til å anslå salget ved 35 35\ ^\circC. Hva må de være klar over, og hva forteller r2r^2 dem?

Løs oppgaven

Presentasjonen

Rapporten er ikke et vedlegg til arbeidet. For alle andre enn deg selv er
rapporten arbeidet. Den følger den samme rekkefølgen som selve undersøkelsen,
og seks deler skal være med:

DelInnholdLengde
1. ProblemstillingOrdrett som i planen, og hvorfor den er interessantNoen linjer
2. MetodePopulasjon, utvalgsmetode, nn, svarprosent, hvordan variablene ble målt, dataloggEn halv side
3. ResultaterTabeller, figurer og tall — uten tolkningEn side
4. AnalyseKonfidensintervall, test, sammenhenger — med tolkningEn side
5. GyldighetFeilkilder, og hvilken vei hver av dem trekkerEn halv side
6. KonklusjonSvaret på problemstillingen, med forbeholdNoen linjer

Legg merke til skillet mellom del 3 og del 4. I resultatdelen står det som ble
målt. I analysedelen står det du mener det betyr. Blander du dem, kan ikke
leseren skille mellom dataene dine og meningene dine.
✏️Eksempel 5 – To konklusjoner på samme materiale

Elevrådet har to utkast til konklusjon. Vurder dem.

Utkast A: «Undersøkelsen vår viser at elevene bruker altfor mye tid på
skjerm, og at skjermtid ødelegger søvnen. Skjermtiden har økt kraftig siden i
fjor.»

Utkast B: Se løsningen.

Utkast A, setning for setning:

- «altfor mye» — en verdivurdering. Undersøkelsen har ikke målt noen grense
for hva som er for mye, og kan derfor ikke belegge ordet.
- «skjermtid ødelegger søvnen» — en årsakspåstand fra observerte data
(kapittel 2.4). Sammenhengen er målt; retningen er ikke.
- «økt kraftig» — testen forkastet H0H_05 %5\ \%-nivå, men ikke på
1 %1\ \%. Forskjellen er 1919 minutter, mot en feilmargin på 1818. «Kraftig»
er ikke dekkende.
- «elevene» — hvilke? Dataene gjelder VG2 ved én skole, på én dag, og bare
telefonen.

Utkast B — en konklusjon materialet bærer:

Blant de 3636 VG2-elevene som svarte, var gjennomsnittlig skjermtid på
telefonen mandag 15. september 219219 minutter. Et 95 %95\ \% konfidensintervall
for gjennomsnittet blant alle 184184 VG2-elevene er [201 ; 237][\,201 \ ;\ 237\,]
minutter. En ensidig test forkaster H0H_0: μ=200\mu = 2005 %5\ \%-nivå
(z=2,08z = 2{,}08, p=0,019p = 0{,}019), men ikke på 1 %1\ \%-nivå. Vi har altså et
visst, men ikke sterkt, belegg for at skjermtiden er høyere enn de 200200
minuttene elevrådet målte i fjor.

Vi fant også en middels sterk negativ sammenheng mellom skjermtid og søvn
natten etter (r=0,55r = -0{,}55). Undersøkelsen kan ikke avgjøre om skjermtid
går ut over søvnen, om dårlig søvn gir mer skjermtid, eller om begge deler
henger sammen med noe tredje.

Resultatet gjelder telefonbruk på én skoledag ved én skole, blant de
90 %90\ \% av de trukne elevene som svarte. PC og nettbrett er ikke målt.
Sammenligningen med fjorårets tall forutsetter at undersøkelsen den gangen
ble gjort på samme måte; det har vi ikke kunnet kontrollere.

Hva utkast B gjør, som A ikke gjør: hvert tall står sammen med
usikkerheten sin, hver påstand er begrenset til det som faktisk ble målt, og
det som ikke kan avgjøres, står som noe som ikke kan avgjøres.

Svar: Utkast A går lenger enn dataene på fire punkter. Utkast B er
dekkende.

Oppsummering

I dette kapittelet har du lært:

- Datarydding: rett format, håndter manglende svar, og fjern bare det som
er umulig — aldri det som bare er uvanlig. Alt du gjør, føres i
dataloggen, som er en del av rapporten.
- Analysetrappa: beskriv først (xˉ\bar{x}, ss, femtallssammendrag,
histogram), så sammenlign eller se sammenheng, og generaliser til slutt. Gå
bare så langt som problemstillingen krever.
- Generalisering: konfidensintervallet sier hvor μ\mu trolig ligger,
hypotesetesten sier om materialet er sterkt nok til å forkaste påstanden.
Med n30n \geq 30 kan ss brukes i stedet for σ\sigma.
- Sammenheng: tegn spredningsplottet før du regner rr, og bruk
regresjonslinja bare når sammenhengen ser lineær ut. r2r^2 sier hvor stor
andel av variasjonen som henger sammen med den andre variabelen.
- Rapporten i seks deler, med resultater og tolkning i hver sin del.
- Konklusjonen skal svare på problemstillingen, oppgi usikkerheten, og
begrense seg til det som faktisk ble målt.

Vurderingskriterier for det utforskende arbeidet

KriteriumHva som vurderes
Statistiske begreperPopulasjon, utvalg, xˉ\bar{x} og μ\mu, ss og σ\sigma, signifikansnivå og pp-verdi brukes presist og riktig
GjennomføringDataene er ryddet og dokumentert; analysen er den problemstillingen krever
GyldighetFeilkilder er vurdert, og det står hvilken vei hver av dem trekker
PresentasjonSeks deler, figurer med akser og bildetekst, tall med riktig antall desimaler
KonklusjonSvarer på problemstillingen, med usikkerhet og med riktig rekkevidde

Husk


- Resultater og tolkning i hver sin del av rapporten.
- Det du ikke kan avgjøre, skal stå som noe du ikke kan avgjøre.
📝Oppgave 5
Prosjektoppgave (Del 2 — regneark). Gjennomfør arbeidet du planla i
kapittel 8.1, og lever rapporten i seks deler.

Bruker du en offentlig kilde i stedet for egen innsamling, er dette et forslag
som fungerer: last ned folketallet i kommunen din 1. januar hvert år fra SSBs
statistikkbank for de siste ti årene, og undersøk problemstillingen «Hvordan
har folketallet i kommunen endret seg fra 2015 til 2025, og hvilken årlig
vekstrate svarer endringen til?»

Regnearket skal inneholde et eget ark for rådata og et for analyse, slik at
rådataene aldri overskrives.

a

Legg inn rådataene, rydd dem, og skriv dataloggen som en tabell i arket.

b

Oppgi nn, og svarprosenten dersom du har samlet inn data selv. Har du brukt en kilde: oppgi hvem, når og hvordan kilden samlet inn dataene.

c

Gjør den beskrivende analysen: =GJENNOMSNITT(...), =MEDIAN(...), =STDAV.S(...), =MIN(...), =MAKS(...), og minst én figur.

d

Generaliser: regn ut et 95 %95\ \% konfidensintervall, eller gjennomfør hypotesetesten fra planen din. Bruker du en totaltelling, forklar hvorfor ingen av delene trengs.

e

Skriv gyldighetsdelen og konklusjonen. Konklusjonen skal ikke være lengre enn ti linjer.

📝Oppgave 6
Prosjektoppgave (Del 2 — simulering). I eksempel 3 fant vi p0,019p \approx 0{,}019 med formelen fra kapittel 7.5. Nå skal du finne den samme
pp-verdien med simulering (kapittel 4.8), uten å bruke
normalfordelingstabellen.

Ideen er den samme som i enhver hypotesetest: vi later som om H0H_0 er sann,
utfører undersøkelsen mange ganger under den forutsetningen, og teller hvor
ofte vi får et gjennomsnitt minst så høyt som det vi faktisk fikk.

Et program som gjør det:

import random

antall = 100000
mu = 200
sigma = 55
n = 36
observert = 219.17
treff = 0

for i in range(antall):
    sum_x = 0
    for j in range(n):
        sum_x = sum_x + random.gauss(mu, sigma)
    if sum_x / n >= observert:
        treff = treff + 1

print(treff / antall)
a

Forklar linje for linje hva programmet gjør, og hvor i programmet forutsetningen «H0H_0 er sann» ligger.

b

Hva slags tall venter du at programmet skriver ut? Begrunn ut fra eksempel 3.

c

Sett opp den samme simuleringen i regneark, med 20002\,000 forsøk.

d

Kjør simuleringen flere ganger med 20002\,000 forsøk og noter svarene. Hvorfor blir de ikke like, og hvor stor er usikkerheten i selve simuleringen?

e

Drøft: hva vinner vi på å gjøre testen med simulering i stedet for med formelen, og hva taper vi?

Løs oppgaven
📝Oppgave 7
Drøftingsoppgave. En lokalavis skriver:

«Elevene ved fylkets skoler bruker nesten fire timer på telefonen hver
dag»

En ny undersøkelse fra elevrådet ved Fjordbyen videregående viser at elevene
i snitt bruker 219219 minutter på telefonen. Undersøkelsen viser også at
skjermtid går ut over søvnen.

Undersøkelsen er den du har arbeidet med i dette kapittelet.

a

Overskriften sier «elevene ved fylkets skoler». Hva var populasjonen, og hva heter feilen?

b

Tallet 219219 står uten usikkerhet. Skriv om setningen slik at usikkerheten kommer med.

c

«Undersøkelsen viser også at skjermtid går ut over søvnen.» Hvorfor er dette ikke dekkende, og hva ville det krevd å vise det?

d

«Hver dag» — hva ble faktisk målt, og hvorfor er forskjellen viktig?

e

Skriv en overskrift og en ingress på til sammen høyst fem linjer som er dekkende for det undersøkelsen viser.

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.