Tilbake
3.3

3.3 Sentralgrenseteoremet og normaltilnærming

CLT presist formulert — og normaltilnærmingen av binomisk, Poisson og estimatorer med gyldighetssjekken sensor alltid gjør.

50 min
7 oppgaver
Sentralgrenseteoremetnormaltilnærming
Din fremgang i kapitlet
0 / 7 oppgaver
Forkunnskaper: Du må kunne fordelingen til gjennomsnittet XˉN(μ,σ2/n)\bar{X} \sim N(\mu, \sigma^2/n) fra kap. 3.2 og standardisering fra kap. 3.1. Du bør også kjenne binomisk- og Poisson-fordelingen med deres EE og Var fra kap. 2.2 (binomisk: E=npE = np, Var=np(1p)\text{Var} = np(1-p); Poisson: E=Var=λtE = \text{Var} = \lambda t).

Kapitlet er forkunnskap for konfidensintervall og hypotesetester senere, og for drillkapitlet kap. 3.4.

Hvorfor er så mange størrelser tilnærmet normalfordelte — selv når de enkelte bidragene ikke er det? Svaret er sentralgrenseteoremet: summer og gjennomsnitt av mange uavhengige bidrag blir tilnærmet normale, nesten uansett hva de enkelte bidragene er fordelt som. Det er dette som gjør normalfordelingen til statistikkens arbeidshest.

Tre løkker: Løkke 1 (ca. 15 min) — teoremet formulert presist, med alle tre forutsetninger. Løkke 2 (ca. 20 min) — den viktigste anvendelsen: normaltilnærming av binomiske andeler, med gyldighetssjekken. Løkke 3 (ca. 15 min) — Poisson, ML-estimatorer og når tilnærmingen svikter. Teori → eksempel → oppgave.

Løkke 1 — Sentralgrenseteoremet, presist formulert

📜Sentralgrenseteoremet (CLT)
La X1,X2,,XnX_1, X_2, \ldots, X_n være uavhengige og identisk fordelte (iid) stokastiske variable med forventning E(Xi)=μE(X_i) = \mu og endelig varians Var(Xi)=σ2<\text{Var}(X_i) = \sigma^2 < \infty. Da er det standardiserte gjennomsnittet tilnærmet standardnormalt for stor nn:

Xˉμσ/n  n  N(0,1).\frac{\bar{X} - \mu}{\sigma/\sqrt{n}} \ \xrightarrow{\ n \to \infty\ }\ N(0, 1).

Ekvivalent: Xˉ\bar{X} er tilnærmet N(μ,σ2/n)N(\mu, \sigma^2/n), og summen Xi\sum X_i er tilnærmet N(nμ,nσ2)N(n\mu, n\sigma^2) — for stor nn.

Alle tre forutsetningene må med når du formulerer teoremet: (1) uavhengige, (2) identisk fordelte, (3) endelig varians. Det bemerkelsesverdige er at fordelingen til de enkelte XiX_i kan være hva som helst (skjev, diskret, tung) — bare de tre kravene holder, blir gjennomsnittet normalt.

Intuisjon: hver XiX_i bidrar med sin egen tilfeldige «dytt» opp eller ned. Når du legger sammen mange uavhengige dytt, jevner de ekstreme utfallene hverandre ut, og summen samler seg i en symmetrisk klokke rundt nμn\mu. Jo større nn, jo bedre tilnærming — tommelfingerregelen n30n \ge 30 holder ofte, men skjeve fordelinger krever større nn.
✏️Eksempel 1: CLT på ikke-normale data

Levetiden til en LED-pære er eksponensialfordelt med forventning β=40\beta = 40 tusen timer (og dermed standardavvik σ=β=40\sigma = \beta = 40, sterkt høyreskjev). Et parti på n=64n = 64 pærer testes, og gjennomsnittlig levetid Xˉ\bar{X} regnes ut. Bruk CLT til å finne tilnærmet P(Xˉ<35)P(\bar{X} < 35).

De 6464 levetidene er iid med μ=40\mu = 40 og σ=40\sigma = 40, altså σ2=1600<\sigma^2 = 1600 < \infty — forutsetningene for CLT holder. Med n=64n = 64 er gjennomsnittet tilnærmet

Xˉ  N ⁣(40, 160064)=N(40, 25),SD(Xˉ)=5.\bar{X} \ \approx\ N\!\left(40,\ \frac{1600}{64}\right) = N(40,\ 25), \qquad SD(\bar{X}) = 5.

Standardiser:

z=35405=1,00,P(Xˉ<35)Φ(1,00)=10,8413=0,1587.z = \frac{35 - 40}{5} = -1{,}00, \qquad P(\bar{X} < 35) \approx \Phi(-1{,}00) = 1 - 0{,}8413 = 0{,}1587.

Altså ca. 16 %. Legg merke til at selve pærelevetiden er langt fra normal, men gjennomsnittet av 64 er godt tilnærmet normalt — det er hele poenget med teoremet.

📝Oppgave 1

(Innstegsoppgave — gjengivelse.) Fyll ut sentralgrenseteoremet:

a) Hvilke tre forutsetninger må X1,,XnX_1, \ldots, X_n oppfylle?

b) Hva blir det standardiserte gjennomsnittet Xˉμσ/n\dfrac{\bar{X} - \mu}{\sigma/\sqrt{n}} tilnærmet fordelt som for stor nn?

— naturlig pausepunkt —

Løkke 2 — Normaltilnærming av binomiske andeler

Den viktigste anvendelsen: en binomisk andel er en sum av mange uavhengige ja/nei-bidrag, så CLT gjør den tilnærmet normal. Dette er ryggraden i meningsmålinger og kvalitetskontroll.

Normaltilnærming av en andel
La Xbinomisk(n,p)X \sim \text{binomisk}(n, p) og p^=X/n\hat{p} = X/n være den observerte andelen suksesser. Siden XX er en sum av nn uavhengige Bernoulli-bidrag, gir CLT for stor nn:

p^  N ⁣(p, p(1p)n),X  N(np, np(1p)).\hat{p} \ \approx\ N\!\left(p,\ \frac{p(1-p)}{n}\right), \qquad X \ \approx\ N\big(np,\ np(1-p)\big).

Andelen har altså standardfeil p(1p)/n\sqrt{p(1-p)/n}. Dette lar oss regne halesannsynligheter for p^\hat{p} med Φ\Phi-tabellen i stedet for tunge binomiske summer.

Gyldighetssjekken npnp og n(1p)n(1-p)
Tilnærmingen er bare god når fordelingen ikke ligger for tett opp mot 0 eller 1. Tommelfingerregelen (som sensor krever eksplisitt):

np5ogn(1p)5np \ge 5 \quad \text{og} \quad n(1-p) \ge 5

(noen bøker bruker 10\ge 10). Skriv alltid ut denne sjekken før du tilnærmer — det er en fast del av fasiten. Er begge store nok, er normaltilnærmingen god; er én av dem liten, er fordelingen for skjev, og du bør regne eksakt binomisk i stedet.

✏️Eksempel 2: Meningsmåling (andel)

En meningsmåling med n=900n = 900 spurte gir en oppslutning p^=0,54\hat{p} = 0{,}54. Anta at den sanne andelen er p=0,52p = 0{,}52. Begrunn at normaltilnærmingen kan brukes, og finn tilnærmet P(p^>0,56)P(\hat{p} > 0{,}56).

Gyldighetssjekk først: np=9000,52=468np = 900 \cdot 0{,}52 = 468 og n(1p)=9000,48=432n(1-p) = 900 \cdot 0{,}48 = 432. Begge er langt over 5, så normaltilnærmingen er god.

Fordeling: p^N ⁣(0,52, 0,520,48900)\hat{p} \approx N\!\left(0{,}52,\ \dfrac{0{,}52 \cdot 0{,}48}{900}\right). Standardfeilen er

SD(p^)=0,2496900=0,0002773=0,016653.SD(\hat{p}) = \sqrt{\frac{0{,}2496}{900}} = \sqrt{0{,}0002773} = 0{,}016653.

Standardiser og slå opp:

z=0,560,520,016653=2,40192,40,P(p^>0,56)1Φ(2,40)=10,9918=0,0082.z = \frac{0{,}56 - 0{,}52}{0{,}016653} = 2{,}4019 \approx 2{,}40, \qquad P(\hat{p} > 0{,}56) \approx 1 - \Phi(2{,}40) = 1 - 0{,}9918 = 0{,}0082.

Altså bare ca. 0,8 % — en oppslutning over 0,560{,}56 ville vært overraskende høy hvis sannheten er 0,520{,}52. (Den observerte 0,540{,}54 i oppgaveteksten er selve målingen; her regnet vi sannsynligheten under antagelsen p=0,52p = 0{,}52.)

📝Oppgave 2

En produksjonslinje har feilandel p=0,05p = 0{,}05. Det trekkes n=400n = 400 enheter, og andelen defekte p^\hat{p} registreres.

a) Kan normaltilnærmingen brukes? Sjekk gyldigheten.

b) Finn tilnærmet P(p^>0,07)P(\hat{p} > 0{,}07).

— naturlig pausepunkt —

Løkke 3 — Poisson, ML-estimatorer og når tilnærmingen svikter

Normaltilnærming av Poisson
For en Poisson-variabel XPoisson(λt)X \sim \text{Poisson}(\lambda t) er både forventning og varians lik λt\lambda t. For stor λt\lambda t (tommelfingerregel λt15\lambda t \ge 15) er XX tilnærmet normal:

X  N(λt, λt).X \ \approx\ N(\lambda t,\ \lambda t).

Dette følger av CLT fordi en Poisson over et langt intervall kan ses som en sum av mange uavhengige Poisson-bidrag over småintervaller.

Kontinuitetskorreksjon
Når vi tilnærmer en heltallig variabel (XX binomisk eller Poisson) med en kontinuerlig normal, forbedrer vi tilnærmingen ved å utvide grensen med en halv enhet — kontinuitetskorreksjon:

P(Xk)Φ ⁣(k+0,5μσ),P(Xk)1Φ ⁣(k0,5μσ).P(X \le k) \approx \Phi\!\left(\frac{k + 0{,}5 - \mu}{\sigma}\right), \qquad P(X \ge k) \approx 1 - \Phi\!\left(\frac{k - 0{,}5 - \mu}{\sigma}\right).

Den betyr mest når nn (eller λt\lambda t) er moderat. For en andel p^\hat{p} dropper vi den vanligvis. Sjekk hva oppgaven ber om — mange eksamensoppgaver godtar svar både med og uten korreksjonen.

✏️Eksempel 3: Poisson-tilnærming (antall, med kontinuitetskorreksjon)

Antall støtdempende hendelser en bro registrerer på et døgn er XPoisson(λt=100)X \sim \text{Poisson}(\lambda t = 100). Finn tilnærmet P(X>115)P(X > 115).

λt=10015\lambda t = 100 \ge 15, så XN(100,100)X \approx N(100, 100) med SD=100=10SD = \sqrt{100} = 10.

Med kontinuitetskorreksjon: P(X>115)=P(X116)1Φ ⁣(1160,510010)=1Φ(1,55)=10,9394=0,0606.P(X > 115) = P(X \ge 116) \approx 1 - \Phi\!\left(\dfrac{116 - 0{,}5 - 100}{10}\right) = 1 - \Phi(1{,}55) = 1 - 0{,}9394 = 0{,}0606.

Uten korreksjon (også godtatt i mange sett): z=(115100)/10=1,50z = (115 - 100)/10 = 1{,}50, P(X>115)1Φ(1,50)=0,0668P(X > 115) \approx 1 - \Phi(1{,}50) = 0{,}0668.

Begge ligger rundt 6 %; forskjellen viser hvor mye korreksjonen flytter svaret ved moderat λt\lambda t.

Asymptotisk normalitet for ML-estimatorer

Et tredje ansikt av CLT, som du får bruk for i senere i boka (punktestimeringsdelen): estimatorer funnet ved sannsynlighetsmaksimering (ML — maximum likelihood, «størst mulig rimelighet») er også tilnærmet normalfordelte for store utvalg. Det er dette som gjør at vi kan bygge konfidensintervall og tester rundt ML-estimater ved hjelp av Φ\Phi-tabellen. Vi varsler resultatet her; utledningen og bruken kommer i punktestimeringsdelen.

Når tilnærmingen er dårlig

CLT er en grense-egenskap — for endelig nn er den bare tilnærmet. Den svikter når (i) nn er liten, (ii) den underliggende fordelingen er svært skjev, eller (iii) pp er nær 0 eller 1 (så npnp eller n(1p)n(1-p) er liten). I slike tilfeller kan svaret bli merkbart feil. For variansestimater med små utvalg trenger vi derfor et eksakt apparat — kjikvadrat-konfidensintervallet i kjikvadrat-KI-et senere i boka — i stedet for normaltilnærming.

📝Oppgave 3

En nettbutikk får kundeordre som en Poisson-prosess med rate λ=3\lambda = 3 per time. Vi ser på et døgn (t=24t = 24 timer), så antall ordre er XPoisson(72)X \sim \text{Poisson}(72).

a) Begrunn at normaltilnærmingen kan brukes, og oppgi tilnærmet fordeling for XX.

b) Finn tilnærmet P(X<60)P(X < 60) (bruk kontinuitetskorreksjon).

c) En kollega vil bruke samme tilnærming på antall ordre i ett minutt (der λt=3/601=0,05\lambda t = 3/60 \cdot 1 = 0{,}05 per minutt gir svært få). Kommenter om det er forsvarlig.

Begrepsbank til eksamen

Kjernebegrepene fra kapitlet i kortform — grenseteoremet og tilnærmingene.

Begrepsbanken er flashcard-/repetisjonsstoff — den gjentar det du nettopp har lest. Hopp trygt over ved førstegangslesing; tidsanslaget gjelder kjernestoffet.

Sentralgrenseteoremet (kortform)

For iid X1,,XnX_1, \ldots, X_n med forventning μ\mu og endelig varians σ2\sigma^2 er gjennomsnittet tilnærmet normalt for stor nn: XˉN(μ,σ2/n)\bar{X} \approx N(\mu, \sigma^2/n), ekvivalent Xˉμσ/nN(0,1)\displaystyle \frac{\bar{X} - \mu}{\sigma/\sqrt{n}} \approx N(0,1). Fordelingen til de enkelte XiX_i spiller ingen rolle — bare de tre forutsetningene.

iid (uavhengige og identisk fordelte)

«iid» betyr at variablene er uavhengige av hverandre og har samme fordeling (samme μ\mu og σ2\sigma^2). Dette er standardmodellen for et tilfeldig utvalg fra en populasjon, og det er nettopp iid-antagelsen CLT hviler på.

De tre forutsetningene

CLT krever: (1) uavhengige bidrag, (2) identisk fordeling, (3) endelig varians σ2<\sigma^2 < \infty. Utelater du én av dem i en formulering, er svaret ufullstendig hos sensor. Punkt (3) utelukker fordelinger med «uendelig» varians (visse tunge haler).

Standardisert gjennomsnitt

CLT uttrykkes oftest på standardisert form: Z=Xˉμσ/nZ = \dfrac{\bar{X} - \mu}{\sigma/\sqrt{n}} er tilnærmet N(0,1)N(0,1). Nevneren σ/n\sigma/\sqrt{n} er standardfeilen. Denne formen er direkte klar for tabelloppslag og er grunnmuren i konfidensintervall for μ\mu.

Normaltilnærming av en andel

En binomisk andel p^=X/n\hat{p} = X/n er tilnærmet N(p,p(1p)/n)N(p, p(1-p)/n) for stor nn. Standardfeilen er p(1p)/n\sqrt{p(1-p)/n}. Dette er grunnlaget for meningsmålinger og andelstester senere i boka.

Antall kontra andel i binomisk tilnærming

Samme fenomen, to skalaer: antallet XN(np,np(1p))X \approx N(np, np(1-p)), mens andelen p^=X/nN(p,p(1p)/n)\hat{p} = X/n \approx N(p, p(1-p)/n). Velg den skalaen oppgaven bruker, og pass på at standardfeilen matcher (dividert på nn for andelen, ikke for antallet).

Gyldighetssjekken

Før du tilnærmer en binomisk med normal: sjekk np5np \ge 5 og n(1p)5n(1-p) \ge 5 (noen krever 10\ge 10). For Poisson: λt15\lambda t \ge 15. Er kravet brutt, er fordelingen for skjev, og tilnærmingen upålitelig — regn eksakt i stedet.

Poisson-tilnærming

For stor λt\lambda t er XPoisson(λt)X \sim \text{Poisson}(\lambda t) tilnærmet N(λt,λt)N(\lambda t, \lambda t) — forventning og varians er begge λt\lambda t. Nyttig når direkte oppslag i Poisson-tabellen blir upraktisk for store rater.

Kontinuitetskorreksjon (kort)

Når en heltallig variabel tilnærmes med en kontinuerlig normal, justeres grensen med ±0,5\pm 0{,}5: P(Xk)Φ((k+0,5μ)/σ)P(X \le k) \approx \Phi((k + 0{,}5 - \mu)/\sigma). Korreksjonen forbedrer tilnærmingen mest ved moderat nn eller λt\lambda t; for andeler droppes den vanligvis.

Asymptotisk normalitet for ML

For store utvalg er sannsynlighetsmaksimeringsestimatorer (ML-estimatorer) tilnærmet normalfordelte rundt den sanne parameterverdien. Dette er en generalisering av CLT-ideen og gjør det mulig å lage konfidensintervall og tester for nesten hvilken som helst parameter (brukes i senere i boka (punktestimeringsdelen)).

Når tilnærmingen svikter

CLT gjelder i grensen nn \to \infty; for endelig nn er den upålitelig ved (i) liten nn, (ii) sterkt skjev underliggende fordeling, eller (iii) pp nær 0/1. Da trengs eksakte metoder — for eksempel kjikvadrat-KI for varians (kjikvadrat-KI-et senere i boka) i stedet for normaltilnærming.

Repetisjonsoppgaver
Din fremgang
0 / 4 oppgaver
Symbol- og formelliste

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.

Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Norges teknisk-naturvitenskapelige universitet. Dette er ikke offisielt studiemateriell. Les mer.