Tilbake
5.3
Feiltyper og teststyrke

5.3 Feiltyper og teststyrke

Type I og type II feil, teststyrke.

45 min
17 oppgaver
Type I feilType II feilTeststyrkeUtvalgsstørrelse
Du leser den lesevennlige versjonen
Din fremgang i kapitlet
0 / 17 oppgaver

To måter å ta feil på

Et forskningsteam tester en ny medisin. Etter studien står de overfor en beslutning: virker den, eller ikke? Og uansett hva de svarer, kan de ta feil — på to prinsipielt forskjellige måter. De kan konkludere med at medisinen virker når den i virkeligheten ikke gjør det. Eller de kan konkludere med at den ikke virker, mens den i virkeligheten gjør det. Begge feilene har konsekvenser, men svært ulike: den første sender en virkningsløs medisin ut til pasienter; den andre skrinlegger en behandling som kunne hjulpet.

I hypotesetestingens språk: en Type I-feil er å forkaste en sann nullhypotese — en falsk positiv, en falsk alarm. Sannsynligheten for Type I-feil er nøyaktig signifikansnivået: P(Type I)=αP(\text{Type I}) = \alpha. Velger vi α=0,05\alpha = 0{,}05, aksepterer vi altså med åpne øyne at vi i 5 % av tilfellene der H0H_0 er sann, likevel vil rope «effekt!».

En Type II-feil er det motsatte: å ikke forkaste en usann nullhypotese — en falsk negativ, en glipp. Sannsynligheten betegnes β\beta, og her er en viktig asymmetri: mens α\alpha settes direkte av oss, avhenger β\beta av den sanne parameterverdien — som vi ikke kjenner. En liten, subtil effekt er lett å overse (stor β\beta); en stor effekt er vanskelig å gå glipp av (liten β\beta).

Firedelingen er verdt å memorere: forkaster vi H0H_0 når den er sann, begår vi Type I-feil; forkaster vi den når den er usann, gjør vi rett; beholder vi den når den er sann, gjør vi rett; beholder vi den når den er usann, begår vi Type II-feil.

Teststyrke: evnen til å oppdage

Det naturlige neste spørsmålet er: hvis effekten faktisk finnes, hvor stor er sjansen for at testen vår oppdager den? Dette er teststyrken (power): Styrke=1β=P(forkaste H0H0 er usann)\text{Styrke} = 1 - \beta = P(\text{forkaste } H_0 \mid H_0 \text{ er usann}) En test med høy styrke er en god detektor; en test med lav styrke overser virkelige effekter. Tommelfingerregelen i forskning er at styrken bør være minst 0,80 — vi vil oppdage en reell effekt i minst 80 % av tilfellene.

Styrken kan beregnes. For en ensidig test H0:μ=μ0H_0: \mu = \mu_0 mot H1:μ>μ0H_1: \mu > \mu_0 med nivå α\alpha er Styrke=P(Z>zαμ1μ0σ/n)\text{Styrke} = P\left(Z > z_\alpha - \frac{\mu_1 - \mu_0}{\sigma/\sqrt{n}}\right) der μ1\mu_1 er den sanne verdien under alternativet.

Et regneeksempel: vi tester H0:μ=100H_0: \mu = 100 mot H1:μ>100H_1: \mu > 100 med α=0,05\alpha = 0{,}05, n=36n = 36 og σ=12\sigma = 12. Hva er styrken hvis sannheten er μ1=104\mu_1 = 104? Kritisk verdi er z0,05=1,645z_{0{,}05} = 1{,}645, og standardfeilen er 1236=2\displaystyle \frac{12}{\sqrt{36}} = 2, så Styrke=P(Z>1,64542)=P(Z>0,355)=10,361=0,639\text{Styrke} = P\left(Z > 1{,}645 - \frac{4}{2}\right) = P(Z > -0{,}355) = 1 - 0{,}361 = 0{,}639 Bare 63,9 % — testen overser en reell effekt på 4 enheter i over en tredjedel av tilfellene. For en medisinstudie ville det vært i dårligste laget.

Hva gjør vi da? Formelen for nødvendig utvalgsstørrelse snur regnestykket: for ensidig test med ønsket styrke 1β1 - \beta er n=((zα+zβ)σμ1μ0)2n = \left(\frac{(z_\alpha + z_\beta)\,\sigma}{\mu_1 - \mu_0}\right)^2 Vil vi ha α=0,05\alpha = 0{,}05 og styrke 0,80 for å oppdage en endring fra 100 til 105 når σ=15\sigma = 15: med z0,05=1,645z_{0{,}05} = 1{,}645 og z0,20=0,842z_{0{,}20} = 0{,}842 får vi n=(2,487155)2=7,461255,7\displaystyle n = \left(\frac{2{,}487 \cdot 15}{5}\right)^2 = 7{,}461^2 \approx 55{,}7, altså minst 56 observasjoner. Slike styrkeberegninger gjøres før enhver seriøs studie — det er bortkastet å samle data som uansett ikke kan avsløre effekten man leter etter.

📝Oppgave Quiz 1

Dragkampen mellom α, β og n

De tre størrelsene α\alpha, β\beta og nn henger sammen som et trekantdrama. Øker vi α\alpha (slakkere krav), blir det lettere å forkaste H0H_0: β\beta synker og styrken øker — men prisen er flere falske alarmer. Senker vi α\alpha (strengere krav), skjer det motsatte: færre falske positive, men flere oversette effekter. For fast utvalgsstørrelse er α\alpha og β\beta i evig konflikt; å redusere den ene øker den andre.

Den eneste måten å redusere begge på er å øke nn: mer data gir mindre standardfeil, skarpere skille mellom hypotesene, og høyere styrke uten å røre α\alpha. Men data koster tid og penger — derav styrkeberegningene før studiestart. En tredje faktor hjelper også, men er utenfor vår kontroll: effektstørrelsen. Store avvik fra H0H_0 er lette å oppdage; små krever store utvalg.

Til slutt en advarsel som gjelder all forskningslesing: statistisk signifikans er ikke det samme som praktisk betydning. En gigantstudie med n=10000n = 10\,000 kan finne at en medisin senker blodtrykket med 0,5 mmHg, med p-verdi under 0,001 — statistisk bunnsolid, klinisk uinteressant. Omvendt kan en liten studie med n=20n = 20 finne 40 % smertereduksjon med p-verdi 0,08 — ikke signifikant, men potensielt svært viktig; problemet er bare at utvalget var for lite (testen manglet styrke). Stor nn gjør til slutt alle effekter «signifikante», også de trivielle; liten nn kan skjule selv store effekter.

Løsningen er å rapportere konfidensintervaller ved siden av p-verdiene: intervallet viser både hvor stor effekten anslås å være (praktisk relevans) og hvor presist anslaget er (statistisk usikkerhet). En p-verdi alene svarer bare på ett spørsmål; konfidensintervallet svarer på begge.

📝Oppgave Quiz 2

Oppsummering: å veie to onder

Medisinstudien minnet oss om at enhver testbeslutning kan bomme på to måter. Type I-feil er å forkaste en sann H0H_0 — den falske positive, med sannsynlighet lik signifikansnivået α\alpha. Type II-feil er å beholde en gal H0H_0 — den falske negative, med sannsynlighet β\beta, som avhenger av den ukjente, sanne effekten. Teststyrken 1β1 - \beta er testens evne til å avsløre reelle effekter, og bør etter tommelfingerregelen være minst 0,80. Regneeksempelet viste hvordan styrken beregnes — P(Z>zαμ1μ0σ/n)\displaystyle P\left(Z > z_\alpha - \frac{\mu_1 - \mu_0}{\sigma/\sqrt{n}}\right) ga 63,9 % — og hvordan formelen n=((zα+zβ)σδ)2\displaystyle n = \left(\frac{(z_\alpha + z_\beta)\sigma}{\delta}\right)^2 forteller hvor stort utvalg en ønsket styrke koster.

De tre størrelsene danner en dragkamp: lavere α\alpha gir strengere test, men høyere β\beta; større reell effekt og mindre spredning gir høyere styrke; og bare økt nn kan senke begge feilsannsynlighetene samtidig. Derfor begynner seriøs forskning med en styrkeberegning — å samle data som ikke kan avsløre effekten, er bortkastet arbeid.

Og den siste lærdommen gjelder alle som leser forskning: signifikant er ikke synonymt med viktig. Kjempeutvalg gjør trivielle effekter signifikante; små utvalg skjuler store. Spør alltid etter både p-verdien og effektstørrelsen — helst i form av et konfidensintervall, som viser begge deler på én gang. Statistikk handler ikke om å unngå feil, for det er umulig; den handler om å vite nøyaktig hvilke feil vi risikerer, og hvor ofte.

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.