Tilbake
6.5

6.5 Hypergeometrisk fordeling

Trekking uten tilbakelegging, hypergeometrisk formel og kvalitetskontroll.

50 min
8 oppgaver
Hypergeometrisk fordelingUten tilbakeleggingKvalitetskontroll
Du leser den lesevennlige versjonen
Din fremgang i kapitlet
0 / 8 oppgaver

Stikkprøven som ikke legger tilbake

En elektronikkfabrikk har produsert et parti på 50 kretskort, og kvalitetssjefen vet at noen av dem kan være defekte. Hun plukker ut 8 kort for testing. Men her er detaljen som endrer all matematikk: når et kort er plukket, legges det ikke tilbake i bunken. For hvert trekk endres sammensetningen av resten — og dermed sannsynlighetene.

I binomialfordelingen antok vi konstant sannsynlighet i hvert forsøk, noe som tilsvarer trekking med tilbakelegging. Kvalitetskontroll, meningsmålinger der 50 respondenter velges fra en gruppe på 500, og Lotto der 7 tall trekkes av 34 — alle er trekking uten tilbakelegging. Slike situasjoner beskrives av den hypergeometriske fordelingen.

Oppsettet er slik: en populasjon har NN objekter, hvorav MM er av typen «suksess» og NMN - M av typen «fiasko». Vi trekker nn objekter uten tilbakelegging, og lar XX være antall suksesser i utvalget. Da er

P(X=k)=(Mk)(NMnk)(Nn)P(X = k) = \frac{\binom{M}{k}\binom{N-M}{n-k}}{\binom{N}{n}}

Logikken bak formelen er ren kombinatorikk: telleren teller måtene å velge kk suksesser blant MM og samtidig nkn-k fiaskoer blant NMN-M; nevneren teller alle måter å velge nn av NN.

Forventningsverdien er behagelig enkel, E(X)=nMN\displaystyle E(X) = n \cdot \frac{M}{N}, mens variansen Var(X)=nMNNMNNnN1\displaystyle \text{Var}(X) = n \cdot \frac{M}{N} \cdot \frac{N-M}{N} \cdot \frac{N-n}{N-1} bærer med seg faktoren NnN1\displaystyle \frac{N-n}{N-1} — den endelige populasjonskorreksjonen — som viser at trekking uten tilbakelegging gir mindre spredning enn med.

📝Oppgave Quiz 1

Kvalitetskontrollen — og snarveien via binomialen

Tilbake til fabrikken. Partiet har N=50N = 50 kort, hvorav M=5M = 5 er defekte, og kvalitetssjefen tester n=8n = 8. Hva er sjansen for at stikkprøven ikke avslører noen defekte i det hele tatt?

P(X=0)=(50)(458)(508)=2155531955368786500,401P(X = 0) = \frac{\binom{5}{0}\binom{45}{8}}{\binom{50}{8}} = \frac{215\,553\,195}{536\,878\,650} \approx 0{,}401

Hele 40 % sjanse for at et parti med 10 % defekte slipper gjennom uten anmerkning! Forventet antall defekte i utvalget er E(X)=8550=0,8\displaystyle E(X) = 8 \cdot \frac{5}{50} = 0{,}8. Og sannsynligheten for å finne minst to? Med P(X=1)0,395P(X = 1) \approx 0{,}395 blir

P(X2)=1P(X=0)P(X=1)10,4010,395=0,204P(X \geq 2) = 1 - P(X = 0) - P(X = 1) \approx 1 - 0{,}401 - 0{,}395 = 0{,}204

Slike beregninger forteller bedriften hvor stor stikkprøven må være for at kontrollen skal være effektiv — en avveining mellom testkostnad og risiko.

Men må vi alltid slite med de store binomialkoeffisientene? Nei. Når utvalget er lite i forhold til populasjonen — tommelfingerregel: n<0,05Nn < 0{,}05 \cdot N — endrer hvert trekk sammensetningen så lite at trekking uten tilbakelegging nesten er det samme som med. Da kan vi approksimere med en binomialfordeling med p=MN\displaystyle p = \frac{M}{N}:

XBin ⁣(n,MN)X \approx \text{Bin}\!\left(n, \frac{M}{N}\right)

Velger du 10 fra en populasjon på 1 000, er binomialen en utmerket tilnærming; velger du 10 fra 15, må du bruke den hypergeometriske. Forskjellen ligger nettopp i den endelige populasjonskorreksjonen: i store populasjoner er den umerkelig, i små er den avgjørende.

📝Oppgave Quiz 2

Oppsummering: matematikken i stikkprøven

Kvalitetssjefens 8 kort fra partiet på 50 var ikke et binomisk forsøk — hvert trekk endret bunken. Den hypergeometriske fordelingen håndterer nettopp dette: med NN objekter, hvorav MM er spesielle, og nn trekk uten tilbakelegging, er

P(X=k)=(Mk)(NMnk)(Nn)P(X = k) = \frac{\binom{M}{k}\binom{N-M}{n-k}}{\binom{N}{n}}

— kombinatorikk i tre etasjer: gunstige valg av suksesser, gunstige valg av fiaskoer, delt på alle mulige utvalg. Forventningsverdien E(X)=nMN\displaystyle E(X) = n \cdot \frac{M}{N} er den samme som for binomialen, mens variansen krympes av den endelige populasjonskorreksjonen NnN1\displaystyle \frac{N-n}{N-1}.

Regnestykkene fra fabrikken viste fordelingens praktiske kraft: 40 % sjanse for at stikkprøven overser alle de defekte kortene er et tall som tvinger fram bedre kontrollrutiner. Og tilnærmingen sparer arbeid: er utvalget under cirka 5–10 % av populasjonen, kan du trygt bruke binomialfordelingen med p=MN\displaystyle p = \frac{M}{N} i stedet — trekkingens påvirkning på bunken er da neglisjerbar.

Kvalitetskontroll, kortspill, lotterier og utvalgsundersøkelser — overalt der noe trekkes uten å legges tilbake, er det denne fordelingen som gjelder. I neste kapittel går vi motsatt vei og ser hva som skjer når antallet forsøk blir stort: da smelter alle disse fordelingene sammen i normalfordelingens klokkeform.

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.