Tilbake
4.3
Normalfordeling og sentralgrensesetningen

4.3 Normalfordeling og sentralgrensesetningen

Normalfordelingen og sentralgrensesetningens betydning.

60 min
23 oppgaver
NormalfordelingSentralgrensesetningenSummen av stokastiske variable
Du leser den lesevennlige versjonen
Din fremgang i kapitlet
0 / 23 oppgaver

Kurven som dukker opp overalt

Mål høyden til tusen norske menn, vei tusen nyfødte, samle testresultater eller målefeil fra et laboratorium — og tegn fordelingen. Hver gang trer den samme formen frem: en symmetrisk, klokkeformet kurve med en topp i midten og slanke haler ut til sidene. Dette er normalfordelingen, den mest brukte sannsynlighetsfordelingen i hele statistikken.

En kontinuerlig stokastisk variabel XX er normalfordelt med forventningsverdi μ\mu og varians σ2\sigma^2, skrevet XN(μ,σ2)X \sim N(\mu, \sigma^2), dersom tetthetsfunksjonen er f(x)=1σ2πe(xμ)22σ2f(x) = \frac{1}{\sigma\sqrt{2\pi}}e^{-\frac{(x-\mu)^2}{2\sigma^2}} Formelen ser dramatisk ut, men egenskapene er enkle å huske: kurven er klokkeformet og symmetrisk om μ\mu, toppunktet ligger i x=μx = \mu, vendepunktene ligger nøyaktig i x=μ±σx = \mu \pm \sigma, arealet under hele kurven er 1, og sannsynligheter er arealer: P(aXb)P(a \leq X \leq b) er arealet under kurven mellom aa og bb.

Det mest praktiske verktøyet er 68-95-99,7-regelen: omtrent 68 % av observasjonene ligger innenfor ett standardavvik fra gjennomsnittet, omtrent 95 % innenfor to, og hele 99,7 % innenfor tre. Er høyden til norske menn normalfordelt med μ=180\mu = 180 cm og σ=7\sigma = 7 cm, ligger altså 68 % mellom 173 og 187 cm. Og andelen over 194 cm — som er μ+2σ\mu + 2\sigma — er halvparten av de 5 prosentene utenfor to standardavvik: omtrent 2,5 %.

Men hvorfor dukker akkurat denne kurven opp overalt? Svaret heter sentralgrensesetningen, og den kommer senere i fortellingen.

Standardisering: alle klokkekurver er én

På nyfødtavdelingen er fødselsvekten tilnærmet normalfordelt med μ=3,5\mu = 3{,}5 kg og σ=0,5\sigma = 0{,}5 kg. Hva er sannsynligheten for at en nyfødt veier mellom 3,0 og 4,0 kg?

Nøkkelen er at alle normalfordelinger egentlig er samme kurve, bare forskjøvet og strukket. Standardnormalfordelingen ZN(0,1)Z \sim N(0, 1) har μ=0\mu = 0 og σ=1\sigma = 1, og enhver normalfordelt XX kan standardiseres: Z=XμσZ = \frac{X - \mu}{\sigma} zz-verdien forteller hvor mange standardavvik XX ligger fra gjennomsnittet. Sannsynligheter slår vi opp i den kumulative fordelingsfunksjonen Φ(z)=P(Zz)\Phi(z) = P(Z \leq z), fra tabell eller kalkulator: P(Xa)=Φ(aμσ)\displaystyle P(X \leq a) = \Phi\left(\frac{a-\mu}{\sigma}\right).

For fødselsvektene: z1=3,03,50,5=1\displaystyle z_1 = \frac{3{,}0 - 3{,}5}{0{,}5} = -1 og z2=4,03,50,5=1\displaystyle z_2 = \frac{4{,}0 - 3{,}5}{0{,}5} = 1. Da er P(3,0<X<4,0)=Φ(1)Φ(1)=0,84130,1587=0,6827P(3{,}0 < X < 4{,}0) = \Phi(1) - \Phi(-1) = 0{,}8413 - 0{,}1587 = 0{,}6827 — som stemmer perfekt med 68-regelen, siden intervallet er nøyaktig μ±σ\mu \pm \sigma.

Vi kan også gå motsatt vei. Hvilken vekt overstiges av bare 5 % av de nyfødte? Vi søker aa slik at P(Xa)=0,95P(X \leq a) = 0{,}95. Tabellen gir Φ(1,645)0,95\Phi(1{,}645) \approx 0{,}95, så a3,50,5=1,645\displaystyle \frac{a - 3{,}5}{0{,}5} = 1{,}645 og a=3,5+0,51,6454,32a = 3{,}5 + 0{,}5 \cdot 1{,}645 \approx 4{,}32 kg.

Noen zz-verdier er verdt å pugge fordi de går igjen i hele statistikken: 1,6451{,}645 (90 %), 1,961{,}96 (95 %) og 2,5762{,}576 (99 %). Og tegn alltid en skisse av klokkekurven med det aktuelle området skravert — det er den beste forsikringen mot å regne på feil hale.

📝Oppgave Quiz 1

Boltene og setningen som forklarer alt

En fabrikk produserer bolter med gjennomsnittslengde μ=50\mu = 50 mm og standardavvik σ=2\sigma = 2 mm — men ingen har sagt at lengdene er normalfordelt. Kvalitetsavdelingen måler 100 bolter og regner ut gjennomsnittet. Hva er sannsynligheten for at gjennomsnittet ligger mellom 49,5 og 50,5 mm?

Her kommer statistikkens kanskje viktigste resultat inn: sentralgrensesetningen. La X1,X2,,XnX_1, X_2, \ldots, X_n være uavhengige stokastiske variabler med samme fordeling, forventning μ\mu og varians σ2\sigma^2. Da gjelder for store nn: summen er tilnærmet normalfordelt, SnN(nμ, nσ2)S_n \approx N(n\mu,\ n\sigma^2), og gjennomsnittet er tilnærmet XˉN(μ, σ2n)\displaystyle \bar{X} \approx N\left(\mu,\ \frac{\sigma^2}{n}\right). Det bemerkelsesverdige er at dette gjelder uansett hvilken fordeling enkeltvariablene har — skjev, hakkete, hva som helst. Summer og gjennomsnitt av mange uavhengige bidrag blir klokkeformede. Tommelfingerregelen er at n30n \geq 30 vanligvis er nok. Det er dette som forklarer hvorfor normalfordelingen dukker opp overalt: høyde, vekt og målefeil er nettopp summer av mange små, uavhengige bidrag.

For boltene: XˉN(50, 4100)\displaystyle \bar{X} \approx N(50,\ \frac{4}{100}), så standardavviket til gjennomsnittet er σXˉ=2100=0,2\displaystyle \sigma_{\bar{X}} = \frac{2}{\sqrt{100}} = 0{,}2 mm — ti ganger mindre enn for en enkelt bolt. Standardisering gir z=49,5500,2=2,5\displaystyle z = \frac{49{,}5 - 50}{0{,}2} = -2{,}5 og z=50,5500,2=2,5\displaystyle z = \frac{50{,}5 - 50}{0{,}2} = 2{,}5, og P(2,5<Z<2,5)=0,99380,0062=0,9876P(-2{,}5 < Z < 2{,}5) = 0{,}9938 - 0{,}0062 = 0{,}9876. Nesten 99 % sikkert at gjennomsnittet treffer innenfor en halv millimeter — selv om vi aldri visste fordelingen til enkeltboltene. Det er sentralgrensesetningens magi: gjennomsnitt er langt mer forutsigbare enn enkeltobservasjoner.

📝Oppgave Quiz 2

Mynten som ble normalfordelt

En siste anvendelse binder sammen forrige kapittel og dette: normalapproksimasjon til binomisk fordeling. En binomisk variabel er jo nettopp en sum av nn uavhengige 0/1-forsøk (Bernoulli-variabler), så sentralgrensesetningen lover at den blir tilnærmet normalfordelt når nn er stor: B(n,p)N(np, np(1p))B(n, p) \approx N(np,\ np(1-p)). Kravet for god tilnærming er np5np \geq 5 og n(1p)5n(1-p) \geq 5.

Men det er én subtilitet: binomisk fordeling er diskret (bare heltall), mens normalfordelingen er kontinuerlig. Derfor bruker vi kontinuitetskorreksjon: heltallet kk «eier» intervallet fra k0,5k - 0{,}5 til k+0,5k + 0{,}5 på den kontinuerlige skalaen. Dermed er P(Xk)Φ(k+0,5npnp(1p))P(X \leq k) \approx \Phi\left(\frac{k + 0{,}5 - np}{\sqrt{np(1-p)}}\right) og punktsannsynligheten P(X=k)P(X = k) blir differansen mellom Φ\Phi i k+0,5k + 0{,}5 og k0,5k - 0{,}5. Korreksjonen gir bedre nøyaktighet, men kan utelates for svært store nn.

Eksempel: en mynt kastes 200 ganger, og vi vil finne sannsynligheten for mellom 90 og 110 kron (inklusivt). XB(200, 0,5)X \sim B(200,\ 0{,}5) har μ=np=100\mu = np = 100 og σ=np(1p)=507,07\sigma = \sqrt{np(1-p)} = \sqrt{50} \approx 7{,}07. Kravene er greit oppfylt (np=n(1p)=100np = n(1-p) = 100). Med kontinuitetskorreksjon: P(90X110)Φ(110,51007,07)Φ(89,51007,07)=Φ(1,48)Φ(1,48)=0,93060,0694=0,8612P(90 \leq X \leq 110) \approx \Phi\left(\frac{110{,}5 - 100}{7{,}07}\right) - \Phi\left(\frac{89{,}5 - 100}{7{,}07}\right) = \Phi(1{,}48) - \Phi(-1{,}48) = 0{,}9306 - 0{,}0694 = 0{,}8612 Omtrent 86 %. En rimelighetskontroll med 68-95-99,7-regelen: [μσ,μ+σ]=[93,107][\mu - \sigma, \mu + \sigma] = [93, 107] skulle gi ca. 68 %, og vårt intervall er litt bredere — 86 % virker fornuftig.

Eksamensstrategien for normalfordeling er dermed komplett: tegn skisse, standardiser, slå opp, sjekk rimelighet — og ved binomisk approksimasjon: sjekk np5np \geq 5 og n(1p)5n(1-p) \geq 5 først, og husk ±0,5\pm 0{,}5.

📝Oppgave Quiz 3

Oppsummering: klokken, kjernen og korreksjonen

Normalfordelingen N(μ,σ2)N(\mu, \sigma^2) er statistikkens arbeidshest: klokkeformet, symmetrisk om μ\mu, med vendepunkter i μ±σ\mu \pm \sigma og totalt areal 1. 68-95-99,7-regelen gir lynraske overslag, og standardiseringen Z=Xμσ\displaystyle Z = \frac{X - \mu}{\sigma} oversetter enhver normalfordeling til standardnormalen N(0,1)N(0,1), der Φ(z)\Phi(z) kan slås opp. Slik fant vi at 68 % av nyfødte veier mellom 3,0 og 4,0 kg, og at bare 5 % veier mer enn 4,32 kg.

Forklaringen på kurvens allestedsnærvær er sentralgrensesetningen: summer og gjennomsnitt av mange uavhengige variabler med samme fordeling blir tilnærmet normalfordelte uansett utgangspunkt — XˉN(μ,σ2n)\displaystyle \bar{X} \approx N(\mu, \frac{\sigma^2}{n}) for n30n \geq 30. Standardavviket til gjennomsnittet, σn\displaystyle \frac{\sigma}{\sqrt{n}}, krymper med utvalgsstørrelsen, og derfor kunne boltefabrikken være 99 % sikker på gjennomsnittet uten å kjenne fordelingen til en eneste bolt.

Og fordi en binomisk variabel er en sum av Bernoulli-forsøk, gjelder normalapproksimasjonen B(n,p)N(np, np(1p))B(n,p) \approx N(np,\ np(1-p)) når np5np \geq 5 og n(1p)5n(1-p) \geq 5 — med kontinuitetskorreksjonen ±0,5\pm 0{,}5 som bro mellom det diskrete og det kontinuerlige, slik myntkast-regnestykket viste.

Husk arbeidsrutinen: tegn skisse, standardiser, slå opp, og sjekk svaret mot 68-95-99,7-regelen. Og merk deg tallene 1,6451{,}645, 1,961{,}96 og 2,5762{,}576 — i kapitlene om estimering og hypotesetesting kommer de tilbake som gamle kjente.

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.