Tilbake
2.4
Normalfordeling og usikkerhet

2.4 Normalfordeling og usikkerhet

Normalfordelingskurven, konfidensintervall og måleusikkerhet.

35 min
5 oppgaver
NormalfordelingUsikkerhetKonfidensintervall
Du leser den lesevennlige versjonen
Din fremgang i kapitlet
0 / 5 oppgaver

Kurven som dukker opp overalt

Mål høyden til hundre tilfeldige voksne, eller fødselsvekten til mange spedbarn, og tegn det i et histogram. Du får nesten alltid den samme formen: en symmetrisk bjelle, høyest i midten og lavere mot kantene. Dette er normalfordelingen, og den er så grunnleggende at den kalles statistikkens ryggrad.

I dette kapittelet skal vi bli kjent med denne kurven og hva den kan fortelle oss. Vi skal også møte en annen grunnsannhet i all naturvitenskap: usikkerhet. Ingen måling er perfekt, og det å forstå og oppgi hvor usikre resultatene er, er noe av det viktigste en forsker gjør.

Bjellekurven og 68-95-99,7-regelen

Normalfordelingen, også kalt Gausskurven, er symmetrisk og bjelleformet. Den bestemmes av bare to tall: gjennomsnittet μ\mu, som setter sentrum av kurven, og standardavviket σ\sigma, som bestemmer hvor bred den er. I en perfekt normalfordeling er gjennomsnitt, median og modus like, kurven er symmetrisk, og det totale arealet under den er 1, altså 100 prosent. De fleste observasjonene ligger nær gjennomsnittet, og stadig færre ligger langt unna.

Det fine er at normalfordelingen følger en presis tommelfingerregel, kjent som 68-95-99,7-regelen. Omtrent 68 prosent av verdiene ligger innenfor ett standardavvik fra gjennomsnittet, altså μ±1σ\mu \pm 1\sigma. Omtrent 95 prosent ligger innenfor to standardavvik, μ±2σ\mu \pm 2\sigma. Og hele 99,7 prosent ligger innenfor tre, μ±3σ\mu \pm 3\sigma. Det betyr at en verdi som ligger mer enn to standardavvik unna snittet er uvanlig, og mer enn tre standardavvik unna er svært sjelden.

La oss bruke regelen. Høyden til voksne menn i Norge er tilnærmet normalfordelt med μ=180\mu = 180 cm og σ=7\sigma = 7 cm. Da ligger omtrent 68 prosent mellom 1807=173180-7 = 173 og 180+7=187180+7 = 187 cm. Omtrent 95 prosent ligger mellom 166 og 194 cm, og 99,7 prosent mellom 159 og 201 cm. En mann på 200 cm er altså mer enn to standardavvik over snittet -- høyere enn rundt 97,5 prosent av befolkningen. Mange virkelige fenomener følger denne kurven: høyde, fødselsvekt, blodtrykk og IQ-skår, som har gjennomsnitt 100 og standardavvik 15.

📝Oppgave Quiz 1

Ingen måling er perfekt

Uansett hvor nøye du måler, vil resultatet aldri være helt perfekt. Måleusikkerhet angir hvor mye et måleresultat kan avvike fra den sanne verdien. Vi skiller mellom to slags feil. Systematiske feil gir konsekvent for høye eller for lave verdier -- som en vekt som alltid viser 50 gram for mye. De er konstante og kan korrigeres når de oppdages, ofte ved kalibrering. Tilfeldige feil varierer derimot fra måling til måling, på grunn av begrensninger i utstyret, menneskelig avlesning eller miljøet. Dem kan vi redusere ved å måle mange ganger.

Nettopp derfor bør et resultat alltid oppgis med usikkerhet, på formen verdi±usikkerhet\text{verdi} \pm \text{usikkerhet}, for eksempel lengde =25,3±0,1= 25{,}3 \pm 0{,}1 cm. Den beste strategien for å minske tilfeldige feil er å gjenta målingen og regne gjennomsnitt -- da jevner feilene seg ut. Usikkerheten i gjennomsnittet, kalt standardfeilen, avtar med σn\displaystyle \frac{\sigma}{\sqrt{n}}, der nn er antall målinger. I tillegg hjelper det å bruke bedre utstyr, kontrollere forholdene, kalibrere mot en kjent standard og bruke riktig avlesningsteknikk.

Tenk deg at du måler lengden på et bord fem ganger og får 120,2, 120,4, 119,8, 120,1 og 120,5 cm. Gjennomsnittet blir 120,2 cm, og standardavviket omtrent 0,27 cm. Standardfeilen blir 0,2750,12\displaystyle \frac{0{,}27}{\sqrt{5}} \approx 0{,}12 cm, så du oppgir resultatet som 120,2±0,1120{,}2 \pm 0{,}1 cm. Den sanne lengden ligger altså trolig mellom 120,1 og 120,3 cm.

📝Oppgave Quiz 2

Konfidensintervall: hvor sikre er vi egentlig?

Når vi vil uttrykke usikkerhet på en formell måte, bruker vi et konfidensintervall -- et intervall som med en angitt sannsynlighet inneholder den sanne verdien. Et 95 prosent konfidensintervall betyr at hvis vi gjentok undersøkelsen mange ganger, ville omtrent 95 av 100 slike intervaller inneholde den sanne verdien.

For normalfordelte data beregner vi et 95 prosent konfidensintervall slik:

xˉ±1,96sn\bar{x} \pm 1{,}96 \cdot \frac{s}{\sqrt{n}}

her er xˉ\bar{x} gjennomsnittet, ss standardavviket og nn antall observasjoner. Tenk deg at en forsker måler reaksjonstiden til 25 personer og får snitt 320 ms med standardavvik 40 ms. Standardfeilen blir 4025=8\displaystyle \frac{40}{\sqrt{25}} = 8 ms, og konfidensintervallet 320±1,968=320±15,7320 \pm 1{,}96 \cdot 8 = 320 \pm 15{,}7, altså fra omtrent 304 til 336 ms. Vi er da 95 prosent sikre på at den sanne gjennomsnittlige reaksjonstiden ligger i dette intervallet.

Et nøkkelpoeng er at intervallet blir smalere når utvalget vokser. Med 100 personer i stedet for 25 ville standardfeilen blitt 40100=4\displaystyle \frac{40}{\sqrt{100}} = 4 ms, og intervallet bare 320±7,8320 \pm 7{,}8. Siden bredden er proporsjonal med sn\displaystyle \frac{s}{\sqrt{n}}, halveres den når utvalget firedobles. Flere observasjoner gir altså mer presis kunnskap. Konfidensintervallet er også nyttig for å vurdere teori mot praksis: måler du tyngdeakselerasjonen i et forsøk og får et intervall som inneholder den teoretiske verdien 9,81 m/s², betyr det at resultatet ditt er forenlig med teorien.

📝Oppgave Quiz 3

Oppsummering

Vi har sett at normalfordelingen er en symmetrisk bjellekurve bestemt av gjennomsnitt μ\mu og standardavvik σ\sigma, og at 68-95-99,7-regelen sier at henholdsvis 68, 95 og 99,7 prosent av verdiene ligger innenfor ett, to og tre standardavvik fra snittet.

Ingen måling er perfekt: vi skiller mellom systematiske feil, som er konstante og kan korrigeres, og tilfeldige feil, som reduseres ved gjentatte målinger. Resultater bør oppgis som verdi ± usikkerhet. Til slutt så vi at konfidensintervallet uttrykker usikkerhet formelt -- og at det blir smalere jo flere observasjoner vi har, fordi presisjonen vokser med 1n\displaystyle \frac{1}{\sqrt{n}}.

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.