Tilbake
4.2
Hypergeometrisk og binomisk fordeling

4.2 Hypergeometrisk og binomisk fordeling

Sammenligning av fordelinger for utvalg med og uten tilbakelegging.

55 min
21 oppgaver
Hypergeometrisk fordelingBinomisk fordelingUtvalgTilnærming
Du leser den lesevennlige versjonen
Din fremgang i kapitlet
0 / 21 oppgaver

To måter å trekke på

Klassen din skal velge en komité, og fem navn trekkes fra en bolle med tretti lapper. Samtidig sitter en medelev og gjetter seg gjennom en flervalgsprøve med ti spørsmål. Begge situasjonene handler om å telle «suksesser» i en serie trekninger — men det er en avgjørende forskjell mellom dem.

Når navnene trekkes fra bollen, legges de ikke tilbake. For hver lapp som trekkes, endrer sannsynlighetene seg for de neste — trekningene er avhengige. Dette beskrives av den hypergeometriske fordelingen. Når medeleven gjetter på spørsmål etter spørsmål, er derimot hvert forsøk helt likt det forrige: samme sannsynlighet hver gang, uavhengig av hva som skjedde før. Det er den binomiske fordelingen.

Disse to fordelingene er blant de viktigste diskrete sannsynlighetsfordelingene, og de er sentrale på S2-eksamen. Den hypergeometriske gjelder trekking uten tilbakelegging fra en endelig populasjon; den binomiske gjelder gjentatte uavhengige forsøk med to mulige utfall. Mye av kunsten ligger nettopp i å avgjøre hvilken modell som passer: Trekker vi uten tilbakelegging fra en liten populasjon? Eller gjør vi uavhengige forsøk — eventuelt trekker fra en populasjon så stor at det nesten ikke spiller noen rolle?

Vi tar dem én av gangen, og avslutter med kvalitetskontrolløren som får bruk for begge.

Bollen med tretti lapper

I klassen er det 30 elever, hvorav 12 jenter, og det trekkes tilfeldig 5 elever til komiteen. Hva er sannsynligheten for at nøyaktig 2 av de 5 er jenter?

Dette er den hypergeometriske grunnsituasjonen: vi trekker nn objekter uten tilbakelegging fra en populasjon med NN objekter, der MM er «suksesser» og NMN - M «fiaskoer». Lar vi XX være antall suksesser blant de nn trukne, er P(X=k)=(Mk)(NMnk)(Nn)P(X = k) = \frac{\binom{M}{k}\binom{N-M}{n-k}}{\binom{N}{n}} der (nk)=n!k!(nk)!\displaystyle \binom{n}{k} = \frac{n!}{k!(n-k)!} er binomialkoeffisienten. Logikken bak formelen er ren telling: antall måter å velge kk suksesser av MM, ganger antall måter å velge resten av fiaskoene, delt på antall måter å velge nn av NN totalt.

For komiteen er N=30N = 30, M=12M = 12, n=5n = 5 og k=2k = 2: (122)=66\binom{12}{2} = 66, (183)=816\binom{18}{3} = 816 og (305)=142506\binom{30}{5} = 142506, så P(X=2)=66816142506=538561425060,378P(X = 2) = \frac{66 \cdot 816}{142506} = \frac{53856}{142506} \approx 0{,}378 — omtrent 37,8 %.

Forventningsverdien er intuitiv: E(X)=nMN=51230=2\displaystyle E(X) = n \cdot \frac{M}{N} = 5 \cdot \frac{12}{30} = 2 jenter — utvalget speiler andelen i populasjonen. Variansen har en ekstra faktor sammenlignet med det binomiske tilfellet: Var(X)=nMNNMNNnN1\displaystyle \text{Var}(X) = n \cdot \frac{M}{N} \cdot \frac{N-M}{N} \cdot \frac{N-n}{N-1}. Den siste brøken, NnN1\displaystyle \frac{N-n}{N-1}, kalles gjerne endelighetskorreksjonen — den krymper variansen fordi trekninger uten tilbakelegging gir litt mindre tilfeldighet enn uavhengige forsøk.

📝Oppgave Quiz 1

Gjettelek med ti spørsmål

Medeleven din har ikke lest til prøven og gjetter vilt på alle ti flervalgsspørsmålene, hvert med fire alternativer. Dette er et binomisk forsøk, kjennetegnet ved tre ting: et fast antall nn uavhengige forsøk, to mulige utfall i hvert forsøk («suksess» med sannsynlighet pp, «fiasko» med 1p1-p), og samme pp i hvert forsøk. Antall suksesser XX er da binomisk fordelt, XB(n,p)X \sim B(n, p), med punktsannsynlighet P(X=k)=(nk)pk(1p)nkP(X = k) = \binom{n}{k}p^k(1-p)^{n-k} Formelen leses naturlig: pkp^k for kk suksesser, (1p)nk(1-p)^{n-k} for resten, og (nk)\binom{n}{k} for alle måtene suksessene kan fordele seg på. Forventning og varians er enkle: E(X)=npE(X) = np og Var(X)=np(1p)\text{Var}(X) = np(1-p), med SD(X)=np(1p)\text{SD}(X) = \sqrt{np(1-p)}.

For gjetteren er XB(10, 0,25)X \sim B(10,\ 0{,}25). Sannsynligheten for nøyaktig 3 riktige: P(X=3)=(103)(0,25)3(0,75)7=1200,0156250,133480,250P(X = 3) = \binom{10}{3}(0{,}25)^3(0{,}75)^7 = 120 \cdot 0{,}015625 \cdot 0{,}13348 \approx 0{,}250. Men for å bestå kreves minst 5 riktige, og da må vi summere: P(X5)=P(X=5)+P(X=6)+0,0584+0,0162+0,0031+0,00040,078P(X \geq 5) = P(X=5) + P(X=6) + \cdots \approx 0{,}0584 + 0{,}0162 + 0{,}0031 + 0{,}0004 \approx 0{,}078. Bare 7,8 % sjanse for å bestå ved ren gjetting — og forventet antall riktige er E(X)=100,25=2,5E(X) = 10 \cdot 0{,}25 = 2{,}5, langt under grensen.

På eksamen møter du ofte spørsmålet «forklar hvorfor dette kan modelleres med binomisk fordeling». Da skal du vise fire ting: det er et fast antall forsøk nn; hvert forsøk har to utfall; sannsynligheten pp er konstant; og forsøkene er uavhengige. Mangler ett av kriteriene — for eksempel fordi det trekkes uten tilbakelegging — er modellen strengt tatt feil.

📝Oppgave Quiz 2

Kvalitetskontrolløren og tommelfingerregelen

På en lampefabrikk står en kvalitetskontrollør med en eske på 100 lyspærer, hvorav 10 er defekte. Hun trekker 5 pærer for inspeksjon. Hva er sannsynligheten for nøyaktig én defekt?

Strengt tatt er dette hypergeometrisk — pærene legges ikke tilbake. Med N=100N = 100, M=10M = 10, n=5n = 5 og k=1k = 1: P(X=1)=(101)(904)(1005)=102555190752875200,3394P(X = 1) = \frac{\binom{10}{1}\binom{90}{4}}{\binom{100}{5}} = \frac{10 \cdot 2555190}{75287520} \approx 0{,}3394

Men legg merke til noe: når populasjonen er stor i forhold til utvalget, endrer sannsynligheten seg nesten ikke fra trekning til trekning. Den første pæren er defekt med sannsynlighet 0,100{,}10; selv etter fire trekninger er sannsynligheten omtrent den samme. Da kan vi approksimere med binomisk fordeling: p=10100=0,1\displaystyle p = \frac{10}{100} = 0{,}1 gir P(X=1)=(51)(0,1)(0,9)4=50,10,6561=0,3281P(X = 1) = \binom{5}{1}(0{,}1)(0{,}9)^4 = 5 \cdot 0{,}1 \cdot 0{,}6561 = 0{,}3281. Avviket fra den eksakte verdien 0,33940{,}3394 er lite.

Tommelfingerregelen sier: binomisk approksimasjon er god når utvalget er mindre enn 5 % av populasjonen, altså n<0,05Nn < 0{,}05N. I eksempelet er n=5n = 5 nøyaktig 5 % av N=100N = 100 — vi er akkurat på grensen, og det synes i den lille forskjellen mellom svarene. Hadde esken inneholdt 10 000 pærer, ville approksimasjonen vært nesten perfekt.

Dermed har kontrolløren et komplett beslutningskart. Trekkes det uten tilbakelegging fra en liten populasjon: hypergeometrisk, med parametre NN, MM, nn. Er forsøkene uavhengige — eller populasjonen svært stor: binomisk, med parametre nn og pp. Forventningene er beslektet, E(X)=nMN\displaystyle E(X) = n\frac{M}{N} mot E(X)=npE(X) = np, og variansene skiller seg bare med endelighetskorreksjonen NnN1\displaystyle \frac{N-n}{N-1}.

📝Oppgave Quiz 3

Oppsummering: med eller uten tilbakelegging

Komitétrekningen, gjetteleken og kvalitetskontrollen viste oss de to store diskrete fordelingene og — viktigst av alt — når hver av dem gjelder.

Den hypergeometriske fordelingen beskriver trekking uten tilbakelegging fra en endelig populasjon: NN objekter, MM suksesser, nn trekninger, og P(X=k)=(Mk)(NMnk)(Nn)\displaystyle P(X = k) = \frac{\binom{M}{k}\binom{N-M}{n-k}}{\binom{N}{n}}. Forventningen er E(X)=nMN\displaystyle E(X) = n\frac{M}{N}, og variansen nMNNMNNnN1\displaystyle n\frac{M}{N}\frac{N-M}{N}\frac{N-n}{N-1} bærer med seg endelighetskorreksjonen som skyldes de avhengige trekningene.

Den binomiske fordelingen XB(n,p)X \sim B(n, p) beskriver nn uavhengige forsøk med to utfall og konstant suksess-sannsynlighet pp: P(X=k)=(nk)pk(1p)nkP(X = k) = \binom{n}{k}p^k(1-p)^{n-k}, med E(X)=npE(X) = np og Var(X)=np(1p)\text{Var}(X) = np(1-p). På eksamen skal du kunne begrunne modellvalget med de fire kriteriene: fast nn, to utfall, konstant pp, uavhengighet.

Broen mellom dem er tommelfingerregelen: når utvalget er under 5 % av populasjonen (n<0,05Nn < 0{,}05N), er den binomiske fordelingen en god tilnærming til den hypergeometriske — slik lyspæreeksempelet viste med 0,3280{,}328 mot eksakt 0,3390{,}339 akkurat på grensen. Spørsmålet du alltid skal stille først, er like enkelt som det er avgjørende: legges lappene tilbake i bollen, eller ikke?

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.