Tilbake
5.5
Bayesiansk statistikk

5.5 Bayesiansk statistikk

Introduksjon til bayesiansk tankegang og oppdatering av sannsynligheter.

50 min
12 oppgaver
Bayes teoremPriorPosteriorBayesiansk oppdateringBetinget sannsynlighet
Du leser den lesevennlige versjonen
Din fremgang i kapitlet
0 / 12 oppgaver

Når klokkekurven svikter

En kvalitetsingeniør tester levetiden til elektroniske komponenter, og dataene er alt annet enn pene: de fleste komponentene varer lenge, men noen få dør tidlig, og fordelingen er kraftig skjev. Z-testene og t-testene fra forrige kapittel forutsetter at dataene er tilnærmet normalfordelte — hva gjør hun nå?

Det samme problemet dukker opp i mange forkledninger. Dataene kan være sterkt skjeve. De kan være ordinale — rangordnede kategorier som «misfornøyd / nøytral / fornøyd», der avstander ikke gir mening. Eller spørsmålet kan handle om noe annet enn et gjennomsnitt: passer fordelingen en bestemt modell? Er to kategoriske variabler uavhengige?

Svaret er ikke-parametriske tester: metoder som ikke krever spesifikke antagelser om fordelingen. De er robuste — de virker uansett hvordan dataene er fordelt — men prisen er at de generelt har noe lavere styrke enn de parametriske testene når normalfordelingen faktisk holder. Du bytter altså bort litt følsomhet mot mye trygghet.

I dette kapittelet møter vi tre slike verktøy. Fortegnstesten tester påstander om medianen ved å telle plusser og minuser. Wilcoxons rangtest gjør det samme, men utnytter mer av informasjonen i dataene. Og kjikvadrattesten håndterer kategoriske data — både om en fordeling passer en modell, og om to variabler henger sammen. Felles for dem alle: ingen krever at noe som helst er normalfordelt.

Å telle plusser og minuser

Produsenten av komponentene hevder at median levetid er 1000 timer. Ingeniøren tester 15 komponenter: 11 varer lenger enn 1000 timer, 4 kortere. Holder påstanden?

Fortegnstesten er kanskje den enkleste hypotesetesten som finnes. Den tester om medianen er lik en bestemt verdi m0m_0, og oppskriften er: beregn differansene di=xim0d_i = x_i - m_0, fjern eventuelle observasjoner der di=0d_i = 0, og tell antall positive (n+n_+) og negative (nn_-) fortegn. Genistreket er at hvis medianen virkelig er m0m_0, er hver observasjon over eller under m0m_0 med lik sannsynlighet — som myntkast! Under H0H_0 er altså n+Bin(n, 0,5)n_+ \sim \text{Bin}(n,\ 0{,}5), og p-verdien hentes rett fra binomialfordelingen.

For komponentene: H0:m=1000H_0: m = 1000 mot H1:m1000H_1: m \neq 1000, med n+=11n_+ = 11 av n=15n = 15. Den tosidige p-verdien er 2P(X11)2 \cdot P(X \geq 11) for XBin(15, 0,5)X \sim \text{Bin}(15,\ 0{,}5), som gir 21941327680,118\displaystyle 2 \cdot \frac{1941}{32768} \approx 0{,}118. Siden 0,118>0,050{,}118 > 0{,}05, forkaster vi ikke H0H_0 — 11 mot 4 er ikke skjevt nok til å felle påstanden med bare 15 observasjoner.

Fortegnstesten kaster imidlertid bort informasjon: den ser bare på hvilken side av m0m_0 observasjonene ligger, ikke hvor langt unna. Wilcoxons rangtest retter på det: beregn di|d_i|, ranger dem fra minst til størst, og summer rangene til de positive differansene til T+T_+. Under H0H_0 er E(T+)=n(n+1)4\displaystyle E(T_+) = \frac{n(n+1)}{4}, og store eller små verdier av T+T_+ er bevis mot hypotesen. Fordi rangene bærer mer informasjon enn fortegnene alene, er Wilcoxon-testen mer effektiv enn fortegnstesten — et godt eksempel på det generelle prinsippet om at mer utnyttet informasjon gir høyere styrke.

📝Oppgave Quiz 1

Kjikvadrat: kategorienes test

En helseforsker undersøker 120 personer og krysstabulerer to kategoriske variabler: trener personen regelmessig, og sover personen godt? Tabellen viser: av 60 som trener, sover 45 godt og 15 dårlig; av 60 som ikke trener, sover 30 godt og 30 dårlig. Henger trening og søvn sammen — eller kunne mønsteret oppstått tilfeldig?

Verktøyet er kjikvadrattesten, som sammenligner observerte frekvenser OiO_i med de forventede frekvensene EiE_i under nullhypotesen: χ2=i=1k(OiEi)2Ei\chi^2 = \sum_{i=1}^{k}\frac{(O_i - E_i)^2}{E_i} Store avvik mellom observert og forventet gir stor χ2\chi^2 — og bevis mot H0H_0. Testen har to hovedvarianter. Tilpasningstesten sjekker om observerte frekvenser passer en gitt fordeling (er terningen rettferdig? følger fødslene en uniform fordeling over ukedagene?), med df=k1df = k - 1 frihetsgrader. Uavhengighetstesten sjekker om to kategoriske variabler er uavhengige; de forventede cellefrekvensene beregnes fra radsummene RiR_i og kolonnesummene CjC_j som Eij=RiCjN\displaystyle E_{ij} = \frac{R_i \cdot C_j}{N}, og frihetsgradene er df=(r1)(c1)df = (r-1)(c-1). I begge tilfeller gjelder kravet at alle forventede frekvenser bør være minst 5.

For trenings-søvn-tabellen: under uavhengighet forventes E11=6075120=37,5\displaystyle E_{11} = \frac{60 \cdot 75}{120} = 37{,}5 godt-sovende blant de trenende, og tilsvarende E12=22,5E_{12} = 22{,}5, E21=37,5E_{21} = 37{,}5, E22=22,5E_{22} = 22{,}5. Kjikvadratverdien blir χ2=(4537,5)237,5+(1522,5)222,5+(3037,5)237,5+(3022,5)222,5=1,5+2,5+1,5+2,5=8,0\chi^2 = \frac{(45-37{,}5)^2}{37{,}5} + \frac{(15-22{,}5)^2}{22{,}5} + \frac{(30-37{,}5)^2}{37{,}5} + \frac{(30-22{,}5)^2}{22{,}5} = 1{,}5 + 2{,}5 + 1{,}5 + 2{,}5 = 8{,}0 Med df=(21)(21)=1df = (2-1)(2-1) = 1 er den kritiske verdien ved α=0,05\alpha = 0{,}05 lik 3,8413{,}841. Siden 8,0>3,8418{,}0 > 3{,}841 forkaster vi H0H_0: det er en statistisk signifikant sammenheng mellom trening og søvnkvalitet. (Om treningen forårsaker den gode søvnen, sier testen derimot ingenting om — det er korrelasjon, ikke kausalitet.)

📝Oppgave Quiz 2

Oppsummering: robust verktøykasse

Kvalitetsingeniørens skjeve levetidsdata viste behovet: når normalfordelingsantagelsen svikter — skjeve data, ordinale kategorier, eller spørsmål om hele fordelinger — trengs ikke-parametriske tester, som ikke forutsetter noen bestemt fordeling. De er robuste, men betaler med noe lavere styrke enn parametriske tester når normalfordelingen faktisk holder.

Fortegnstesten tester medianen med elegant enkelhet: tell observasjoner over og under m0m_0, og bruk at n+Bin(n, 0,5)n_+ \sim \text{Bin}(n,\ 0{,}5) under H0H_0 — hver observasjon er et myntkast om medianen er riktig. Slik fant vi at 11 av 15 komponenter over 1000 timer ga p-verdi 0,118 og ingen forkasting. Wilcoxons rangtest forbedrer styrken ved også å bruke størrelsen på avvikene: ranger di|d_i|, summer de positive rangene til T+T_+, og sammenlign med E(T+)=n(n+1)4\displaystyle E(T_+) = \frac{n(n+1)}{4}.

Kjikvadrattesten χ2=(OiEi)2Ei\displaystyle \chi^2 = \sum\frac{(O_i - E_i)^2}{E_i} er kategoridataenes arbeidshest, i to varianter: tilpasningstesten (df=k1df = k - 1) sjekker om frekvenser passer en gitt fordeling, og uavhengighetstesten (Eij=RiCjN\displaystyle E_{ij} = \frac{R_i C_j}{N}, df=(r1)(c1)df = (r-1)(c-1)) sjekker om to variabler henger sammen — slik trening og søvnkvalitet gjorde med χ2=8,0\chi^2 = 8{,}0. Husk kravet Ei5E_i \geq 5, og husk at en påvist sammenheng aldri i seg selv beviser årsak.

Den praktiske regelen til slutt: bruk parametriske tester når forutsetningene holder — de er kraftigst — og ha de ikke-parametriske klare som robust reserve når virkelighetens data nekter å oppføre seg som klokkekurver.

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.