Tilbake
5.2
Hypotesetesting

5.2 Hypotesetesting

Teste hypoteser om forventningsverdi og andel.

65 min
23 oppgaver
HypotesetestNullhypoteseAlternativ hypotesep-verdiSignifikansnivå
Du leser den lesevennlige versjonen
Din fremgang i kapitlet
0 / 23 oppgaver

Påstand mot bevis

En produsent hevder at sjokoladeplatene veier 500 gram. En forsker hevder at en ny medisin virker bedre enn placebo. Et parti hevder å ha minst 15 prosent oppslutning. Hvordan avgjør vi om slike påstander holder — når alt vi har, er et utvalg med tilfeldig variasjon i?

Hypotesetesting er statistikkens rettssal: en systematisk metode for å avgjøre om data gir nok bevis til å forkaste en påstand om populasjonen. Og som i rettssalen er rollene strengt fordelt. Nullhypotesen H0H_0 er antakelsen vi starter med — den «tiltalte» som er uskyldig til det motsatte er bevist. Den uttrykker typisk «ingen effekt» eller «ingen forskjell»: μ=500\mu = 500, p=0,15p = 0{,}15. Alternativhypotesen H1H_1 er det vi ønsker å påvise: at det finnes en effekt eller forskjell — μ500\mu \neq 500, p<0,15p < 0{,}15 eller μ>72\mu > 72, avhengig av spørsmålet. En tommelfingerregel for formuleringen: H0H_0 inneholder alltid likhet, mens H1H_1 uttrykker ulikheten vi leter etter (\neq, >> eller <<).

Logikken er kontraintuitiv, men viktig: vi antar at H0H_0 er sann, og spør hvor usannsynlig det observerte resultatet da ville vært. Bare hvis dataene er tilstrekkelig usannsynlige under H0H_0, forkaster vi den. Og merk språket: vi «aksepterer» aldri H0H_0 — vi bare unnlater å forkaste den. Mangel på bevis er ikke bevis for mangel.

For å gjøre «tilstrekkelig usannsynlig» presist trenger vi tre verktøy: en testobservator, en p-verdi og et signifikansnivå. Dem bygger vi i neste seksjon — og så setter vi retten.

Verktøyene: testobservator, p-verdi og signifikansnivå

Testobservatoren måler hvor langt utvalget ligger fra det nullhypotesen forutsier, regnet i standardfeil. For et gjennomsnitt (med stor nn eller kjent σ\sigma): z=xˉμ0s/nz = \frac{\bar{x} - \mu_0}{s/\sqrt{n}} For en andel: z=p^p0p0(1p0)nz = \frac{\hat{p} - p_0}{\sqrt{\frac{p_0(1-p_0)}{n}}} der μ0\mu_0 og p0p_0 er verdiene fra H0H_0. Merk at vi i andelstesten bruker p0p_0 i standardfeilen — vi regner jo under antakelsen om at H0H_0 er sann.

P-verdien er kjernen i hele metoden: sannsynligheten for å observere et resultat like ekstremt eller mer ekstremt enn det vi fikk, gitt at H0H_0 er sann. Lav p-verdi betyr at dataene er usannsynlige under H0H_0 — bevis mot den; høy p-verdi betyr at dataene er forenlige med H0H_0. Hvordan «ekstremt» regnes, avhenger av H1H_1: for tosidig test (H1:μμ0H_1: \mu \neq \mu_0) er p-verdien 2P(Z>z)2 \cdot P(Z > |z|); for ensidig høyre (H1:μ>μ0H_1: \mu > \mu_0) er den P(Z>z)P(Z > z); for ensidig venstre (H1:μ<μ0H_1: \mu < \mu_0) er den P(Z<z)P(Z < z).

Signifikansnivået α\alpha er grensen vi setter på forhånd — vanligvis 0,05, noen ganger 0,01 eller 0,10. Beslutningsregelen er enkel: er p-verdien α\leq \alpha, forkaster vi H0H_0 og kaller resultatet statistisk signifikant; ellers forkaster vi ikke.

Dermed har vi en fast fremgangsmåte i seks steg: (1) formuler H0H_0 og H1H_1, (2) velg α\alpha, (3) beregn testobservatoren, (4) finn p-verdien, (5) konkluder — forkast eller ikke, og (6) tolk resultatet i kontekst. Det siste steget glemmes oftest og er likevel det viktigste: et tall blir først til kunnskap når det oversettes tilbake til virkeligheten.

📝Oppgave Quiz 1

To rettssaker

Sak 1: sjokoladevekten (tosidig test). Produsenten hevder μ=500\mu = 500 g. Et utvalg på n=64n = 64 plater gir xˉ=497,5\bar{x} = 497{,}5 g og s=8s = 8 g. Vi tester på nivå α=0,05\alpha = 0{,}05.

Hypotesene: H0:μ=500H_0: \mu = 500 mot H1:μ500H_1: \mu \neq 500 — tosidig, for et avvik i begge retninger ville interessert oss. Testobservatoren: z=497,55008/64=2,51=2,50z = \frac{497{,}5 - 500}{8/\sqrt{64}} = \frac{-2{,}5}{1} = -2{,}50 Utvalget ligger altså 2,5 standardfeil under påstanden. P-verdien (tosidig): 2P(Z>2,50)=20,0062=0,01242 \cdot P(Z > 2{,}50) = 2 \cdot 0{,}0062 = 0{,}0124. Siden 0,0124<0,050{,}0124 < 0{,}05 forkaster vi H0H_0: det er statistisk signifikant bevis for at vekten avviker fra 500 g — og dataene peker mot at platene er for lette.

Sak 2: partioppslutningen (ensidig test). Et parti hevder minst 15 % oppslutning. I en undersøkelse svarer 52 av 400 at de ville stemt på partiet. Er oppslutningen lavere enn påstått? Hypotesene: H0:p=0,15H_0: p = 0{,}15 mot H1:p<0,15H_1: p < 0{,}15 — ensidig venstre, for det er bare lavere oppslutning vi leter etter. Utvalgsandelen er p^=52400=0,13\displaystyle \hat{p} = \frac{52}{400} = 0{,}13, og z=0,130,150,150,85400=0,020,017861,12z = \frac{0{,}13 - 0{,}15}{\sqrt{\frac{0{,}15 \cdot 0{,}85}{400}}} = \frac{-0{,}02}{0{,}01786} \approx -1{,}12 P-verdien: P(Z<1,12)0,131P(Z < -1{,}12) \approx 0{,}131. Siden 0,131>0,050{,}131 > 0{,}05 forkaster vi ikke H0H_0: avviket på to prosentpoeng er godt innenfor det tilfeldigheten kan forklare med 400 spurte. Vi har ikke grunnlag for å hevde at partiet overdriver — men husk: det beviser heller ikke at oppslutningen faktisk er 15 %.

Legg merke til kontrasten: i sak 1 var beviset sterkt nok til domfellelse, i sak 2 ikke. Begge konklusjonene refererer til signifikansnivået, bruker riktig språk om forkasting, og oversetter resultatet til praktisk mening.

📝Oppgave Quiz 2

Ensidig eller tosidig — og kunsten å konkludere

Valget mellom ensidig og tosidig test er et veivalg som må tas før du ser på dataene. En tosidig test (H1:μμ0H_1: \mu \neq \mu_0, p-verdi 2P(Z>z)2P(Z > |z|)) brukes når du undersøker om det er en forskjell, uansett retning. En ensidig test (H1:μ>μ0H_1: \mu > \mu_0 eller μ<μ0\mu < \mu_0) brukes når bare én retning er faglig interessant. Den ensidige testen er mer «kraftfull» — det er lettere å forkaste H0H_0 fordi all α\alpha legges i én hale — men prisen er at du er blind for avvik i motsatt retning. Å bytte til ensidig test etter å ha sett dataene er juks: da har du i praksis doblet sjansen for falsk alarm.

Et eksempel på berettiget ensidig test: en ny undervisningsmetode hevdes å gi bedre resultater enn den tradisjonelle, som gir μ0=72\mu_0 = 72 poeng. Et utvalg på 50 elever med ny metode gir xˉ=74,8\bar{x} = 74{,}8 og s=9,5s = 9{,}5. Hypotesene er H0:μ=72H_0: \mu = 72 mot H1:μ>72H_1: \mu > 72, og z=74,8729,5/50=2,81,34352,08z = \frac{74{,}8 - 72}{9{,}5/\sqrt{50}} = \frac{2{,}8}{1{,}3435} \approx 2{,}08 P-verdien er P(Z>2,08)0,019<0,05P(Z > 2{,}08) \approx 0{,}019 < 0{,}05: vi forkaster H0H_0. På 5 %-nivå er det signifikant bevis for at den nye metoden gir bedre resultater.

Til slutt: konklusjonen skal alltid formuleres ordentlig. Referer til signifikansnivået («på 5 % signifikansnivå …»), bruk riktig språk («forkaster / forkaster ikke H0H_0») og oversett til kontekst. Ved forkasting: «Det er statistisk signifikant bevis for at [alternativhypotesen].» Uten forkasting: «Det er ikke tilstrekkelig bevis for å hevde at [alternativhypotesen]; vi beholder H0H_0.» Og igjen — et ikke-signifikant resultat betyr ikke at H0H_0 er sann, bare at bevisene ikke holdt denne gangen.

📝Oppgave Quiz 3

Oppsummering: bevisbyrden i tall

Hypotesetesting er en rettssak der tilfeldigheten er forsvarsadvokat. Nullhypotesen H0H_0 — «ingen effekt», alltid med likhet — er uskyldig til det motsatte er bevist, og alternativhypotesen H1H_1 er det vi vil påvise, med retning (>>, <<) eller uten (\neq).

Bevisene veies i tre steg. Testobservatoren z=xˉμ0s/n\displaystyle z = \frac{\bar{x} - \mu_0}{s/\sqrt{n}} (eller z=p^p0p0(1p0)/n\displaystyle z = \frac{\hat{p} - p_0}{\sqrt{p_0(1-p_0)/n}} for andeler) måler avviket fra H0H_0 i standardfeil. P-verdien er sannsynligheten, gitt at H0H_0 er sann, for et minst like ekstremt resultat — én hale for ensidige tester, dobbel hale for tosidige. Og signifikansnivået α\alpha (oftest 5 %) er domsterskelen: pαp \leq \alpha gir forkasting og et «statistisk signifikant» resultat.

Fortellingene viste begge utfall: sjokoladeplatene ble dømt (z=2,5z = -2{,}5, p=0,0124p = 0{,}0124), partipåstanden ble frikjent på tvil (z=1,12z = -1{,}12, p=0,131p = 0{,}131), og den nye undervisningsmetoden fikk medhold i en ensidig test (p=0,019p = 0{,}019). Husk kjørereglene: velg ensidig eller tosidig før du ser dataene; bruk p0p_0 i standardfeilen for andelstester; og formuler konklusjonen med nivå, forkastingsspråk og kontekst.

Og den dypeste regelen av alle: vi aksepterer aldri H0H_0. Et ikke-signifikant resultat betyr at bevisene ikke holdt — kanskje fordi effekten ikke finnes, kanskje fordi utvalget var for lite. Akkurat dét skillet, mellom å frikjenne og å bevise uskyld, er temaet for neste kapittel: feiltyper og teststyrke.

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.