Tilbake
4.1
Sannsynlighetsfordelinger

4.1 Sannsynlighetsfordelinger

Diskrete og kontinuerlige sannsynlighetsfordelinger.

55 min
21 oppgaver
SannsynlighetsfordelingDiskretKontinuerligTetthetsfunksjon
Du leser den lesevennlige versjonen
Din fremgang i kapitlet
0 / 21 oppgaver

Tall styrt av tilfeldigheter

På skoleballet selges lodd til inntekt for russetiden, og du står med ett i hånden. Gevinsten kan bli 0, 50, 100 eller 500 kroner — men hvilken det blir, avgjøres av tilfeldighetene. Antall riktige på en flervalgsprøve du gjetter på, antall kunder i kiosken i storefri, gevinsten i et terningspill: alle er tall bestemt av tilfeldigheter. Slike tallverdier kalles stokastiske variabler, og vi bruker store bokstaver som XX, YY og ZZ for dem.

En diskret stokastisk variabel XX kan ta et endelig (eller tellbart) antall verdier x1,x2,,xnx_1, x_2, \ldots, x_n. Sannsynlighetsfordelingen til XX er en tabell eller formel som angir P(X=xi)P(X = x_i) for hver mulig verdi. To krav må alltid være oppfylt: hver sannsynlighet ligger mellom 0 og 1, og summen av alle sannsynlighetene er nøyaktig 1 — noe må jo skje.

Det enkleste eksempelet er et terningkast. La XX være antall øyne. Da kan XX ta verdiene 1 til 6, hver med sannsynlighet 16\displaystyle \frac{1}{6}, og kontrollen stemmer: 616=1\displaystyle 6 \cdot \frac{1}{6} = 1. Når alle utfall er like sannsynlige, kaller vi det en uniform fordeling.

Men tabellen alene svarer ikke på de spørsmålene vi egentlig stiller: Hva kan jeg vente å vinne på loddet? Og hvor mye varierer resultatet fra gang til gang? Til det trenger vi to nøkkeltall — forventningsverdien og variansen — og det er dem denne fortellingen handler om.

Hva er loddet egentlig verdt?

Lotteriet på ballet har denne gevinstfordelingen: gevinst 0 kr med sannsynlighet 0,600{,}60, 50 kr med 0,250{,}25, 100 kr med 0,100{,}10 og 500 kr med 0,050{,}05. Et lodd koster 40 kroner. Er det verdt det?

Forventningsverdien til en diskret stokastisk variabel er det vektede gjennomsnittet av alle mulige verdier, der vektene er sannsynlighetene: E(X)=μ=i=1nxiP(X=xi)E(X) = \mu = \sum_{i=1}^{n} x_i \cdot P(X = x_i) Tolkningen: gjentar vi forsøket mange ganger, vil gjennomsnittet av resultatene nærme seg E(X)E(X) — det er «langtidsgjennomsnittet».

For loddet: E(X)=00,60+500,25+1000,10+5000,05=0+12,50+10+25=47,50E(X) = 0 \cdot 0{,}60 + 50 \cdot 0{,}25 + 100 \cdot 0{,}10 + 500 \cdot 0{,}05 = 0 + 12{,}50 + 10 + 25 = 47{,}50 kroner. Forventet gevinst er altså 47,50 kr, mens loddet koster 40 kr — forventet nettogevinst er +7,50+7{,}50 kr per lodd. Et slikt lotteri er ikke «rettferdig» i matematisk forstand (forventet gevinst er ikke lik prisen), og i praksis ville arrangøren tapt penger og justert prisen eller sannsynlighetene. Hos kommersielle spillselskaper er regnestykket alltid motsatt: forventningsverdien er lavere enn prisen.

Forventningsverdien følger enkle regneregler: E(aX+b)=aE(X)+bE(aX + b) = aE(X) + b og E(X+Y)=E(X)+E(Y)E(X + Y) = E(X) + E(Y). Forventningen er altså lineær — konstanter kan flyttes ut, og summer kan splittes. For terningen er for eksempel E(X)=1+2++66=3,5\displaystyle E(X) = \frac{1+2+\cdots+6}{6} = 3{,}5; kaster du to terninger, er forventet sum 3,5+3,5=73{,}5 + 3{,}5 = 7 uten videre regning.

📝Oppgave Quiz 1

Spredningen rundt gjennomsnittet

To lotterier kan ha nøyaktig samme forventningsverdi og likevel føles helt forskjellige: ett gir alltid rundt 50 kr, det andre gir som regel null men av og til tusenvis. Forskjellen er spredningen, og målet for den er variansen: Var(X)=σ2=E[(Xμ)2]=i=1n(xiμ)2P(X=xi)\text{Var}(X) = \sigma^2 = E[(X - \mu)^2] = \sum_{i=1}^{n}(x_i - \mu)^2 \cdot P(X = x_i) Variansen er altså det forventede kvadratavviket fra gjennomsnittet. Stor varians betyr stor usikkerhet.

I praksis regner vi nesten alltid med den alternative formelen Var(X)=E(X2)[E(X)]2\text{Var}(X) = E(X^2) - [E(X)]^2, der E(X2)=xi2P(X=xi)E(X^2) = \sum x_i^2 P(X = x_i) — den er raskere fordi du slipper å beregne avviket for hver verdi. Standardavviket σ=Var(X)\sigma = \sqrt{\text{Var}(X)} henter spredningen tilbake til samme enhet som XX (variansen har enheten i andre potens).

Vi regner på terningen. Vi har E(X)=3,5E(X) = 3{,}5. Videre er E(X2)=1+4+9+16+25+366=916\displaystyle E(X^2) = \frac{1 + 4 + 9 + 16 + 25 + 36}{6} = \frac{91}{6}. Da er Var(X)=916(72)2=18214712=35122,92\displaystyle \text{Var}(X) = \frac{91}{6} - \left(\frac{7}{2}\right)^2 = \frac{182 - 147}{12} = \frac{35}{12} \approx 2{,}92, og σ=35/121,71\sigma = \sqrt{35/12} \approx 1{,}71 øyne.

Variansen har sine egne regneregler: Var(aX+b)=a2Var(X)\text{Var}(aX + b) = a^2\text{Var}(X). Legg merke til at konstanten bb forsvinner — å legge til et fast beløp forskyver fordelingen, men endrer ikke spredningen. Og koeffisienten kvadreres. For uavhengige variabler gjelder dessuten Var(X+Y)=Var(X)+Var(Y)\text{Var}(X + Y) = \text{Var}(X) + \text{Var}(Y).

Et eksempel som samler alt: XX har E(X)=5E(X) = 5 og Var(X)=4\text{Var}(X) = 4, og vi lar Y=3X2Y = 3X - 2. Da er E(Y)=352=13E(Y) = 3 \cdot 5 - 2 = 13, Var(Y)=324=36\text{Var}(Y) = 3^2 \cdot 4 = 36 og SD(Y)=6\text{SD}(Y) = 6.

📝Oppgave Quiz 2

Oppsummering: to tall som beskriver tilfeldigheten

Fra loddsalget på skoleballet har vi bygget hele grunnmuren for sannsynlighetsregningen i S2. En stokastisk variabel er en tallverdi styrt av tilfeldigheter, og sannsynlighetsfordelingen er oversikten over P(X=x)P(X = x) for alle mulige verdier — med kravene at hver sannsynlighet ligger mellom 0 og 1 og at summen er nøyaktig 1.

To nøkkeltall beskriver fordelingen. Forventningsverdien E(X)=xiP(X=xi)E(X) = \sum x_i P(X = x_i) er det vektede gjennomsnittet og tolkes som langtidsgjennomsnittet ved mange gjentakelser — det var slik vi fant at lotteriloddet var verdt 47,50 kr og at et terningkast i snitt gir 3,5 øyne. Variansen Var(X)=E(X2)[E(X)]2\text{Var}(X) = E(X^2) - [E(X)]^2 måler spredningen rundt gjennomsnittet, og standardavviket σ=Var(X)\sigma = \sqrt{\text{Var}(X)} uttrykker den i samme enhet som XX.

Regnereglene gjør tunge beregninger lette: forventningen er lineær, E(aX+b)=aE(X)+bE(aX + b) = aE(X) + b og E(X+Y)=E(X)+E(Y)E(X + Y) = E(X) + E(Y), mens variansen følger Var(aX+b)=a2Var(X)\text{Var}(aX + b) = a^2\text{Var}(X) — konstantledd forsvinner, koeffisienter kvadreres — og for uavhengige variabler adderes variansene: Var(X+Y)=Var(X)+Var(Y)\text{Var}(X + Y) = \text{Var}(X) + \text{Var}(Y).

Disse begrepene er språket alt det neste uttrykkes i: binomisk og hypergeometrisk fordeling, normalfordelingen og etter hvert estimering og hypotesetesting. Hver gang du møter en ny fordeling, er de to første spørsmålene alltid de samme: hva er forventningsverdien, og hvor stor er spredningen?

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.