Nullhypotese, alternativ hypotese, signifikansnivå og type I/II-feil.
Ekte effekt eller bare flaks?
Tenk deg at du tester et nytt treningsprogram, og deltakerne i snitt løper 18 sekunder raskere etterpå. Virker programmet? Eller var det bare tilfeldigheter -- en god dag, riktig vær, litt flaks? Dette er det grunnleggende spørsmålet i all empirisk forskning, og hypotesetesting er den systematiske metoden for å svare på det.
Enhver hypotesetest starter med to motstridende påstander. Nullhypotesen er utgangspunktet -- «status quo», påstanden om at det ikke finnes noen effekt, forskjell eller sammenheng. Det er denne vi prøver å motbevise. Alternativhypotesen er forskerens egentlige påstand: at det er en effekt.
Logikken er indirekte, som et bevis ved selvmotsigelse. Først antar vi at er sann. Så regner vi ut hvor sannsynlig det er å se et resultat minst like ekstremt som vårt, gitt at stemmer. Er den sannsynligheten svært liten, konkluderer vi at neppe er sann, og forkaster den til fordel for . Vi beviser altså aldri direkte -- vi argumenterer for at dataene er for usannsynlige under . En bilprodusent som hevder forbruket er 0,50 l/mil, vil møte hypotesene mot hvis en forbrukerorganisasjon mistenker høyere forbruk -- en ensidig test, fordi mistanken peker i én retning.
P-verdien -- det mest misforståtte tallet
Kjernen i hypotesetesting er p-verdien. Den svarer på ett presist spørsmål: «Hvis nullhypotesen er sann, hvor sannsynlig er det å observere et resultat minst like ekstremt som det vi faktisk fikk?» En liten p-verdi betyr at resultatet er usannsynlig under -- altså et tegn på at kanskje ikke stemmer.
Før vi tester, velger vi et signifikansnivå , grensen for hva som er «lite nok». Det vanligste er . Beslutningsregelen er enkel: er , forkaster vi og kaller resultatet statistisk signifikant; er , har vi ikke nok evidens. Fant treningsstudien , betyr det at en forbedring på 18 sekunder ville vært ekstremt usannsynlig hvis programmet var virkningsløst -- så vi forkaster .
Men p-verdien er kanskje vitenskapens mest misforståtte begrep, så hør nøye etter. P-verdien er ikke sannsynligheten for at er sann. Den er ikke sannsynligheten for at resultatet skyldes tilfeldigheter. Den sier ingenting om hvor stor effekten er. Og statistisk signifikans betyr ikke automatisk praktisk betydning. P-verdien er bare en betinget sannsynlighet: sannsynligheten for dataene gitt at er sann, . Når treningsstudien gir , sier vi ikke at det er 99,6 % sjanse for at programmet virker -- bare at dataene er svært usannsynlige hvis det ikke virker. Ulike fagfelt velger ulike grenser: er standard, brukes i medisin og partikkelfysikk, og i pilotstudier.
To feil vi alltid risikerer
Uansett hvor nøye vi er, kan en statistisk beslutning være feil -- og det finnes nøyaktig to måter å bomme på. En type I-feil (falsk positiv) er å forkaste når den faktisk er sann: vi roper «effekt!» når det ikke er noen. Sannsynligheten for dette er nettopp signifikansnivået . En type II-feil (falsk negativ) er å ikke forkaste når den faktisk er usann: vi overser en ekte effekt. Sannsynligheten for dette kalles .
Et dagligdags bilde gjør det tydelig. Tenk på en brannalarm, der er «ingen brann». Type I-feil er en falsk alarm -- irriterende, men sjelden farlig. Type II-feil er en uoppdaget brann -- potensielt dødelig. Derfor stilles brannalarmer svært sensitivt: vi godtar mange falske alarmer for å unngå å overse en ekte brann. I medisin er ofte type I-feil verst, fordi et uvirksomt medikament kan tas i bruk, og derfor brukes gjerne strengere .
Den lyse siden av type II-feilen er teststyrken: , sannsynligheten for å faktisk oppdage en reell effekt. Styrken øker med større utvalg, større ekte effekt, høyere (men det øker også type I-risikoen) og mindre variasjon i dataene. En vanlig tommelregel er at styrken bør være minst 0,80. De to feiltypene står i et spenningsforhold -- senker du , øker -- og den eneste veien til å redusere begge samtidig er å samle inn mer data. Dette forklarer også hvorfor en studie kan finne en «stor» forskjell uten at den blir signifikant: med for lite utvalg mangler den rett og slett teststyrke til å fange effekten.
Oppsummering
Vi har sett at hypotesetesting lar oss skille ekte effekt fra tilfeldighet. Nullhypotesen står for «ingen effekt», mens alternativhypotesen er forskerens påstand, som kan være ensidig eller tosidig. P-verdien er sannsynligheten for data minst så ekstreme som de observerte, gitt at er sann, og vi forkaster når .
Vi risikerer alltid to feil: type I (falsk positiv, sannsynlighet ) og type II (falsk negativ, sannsynlighet ). Teststyrken bør være minst 0,80 og øker med utvalgsstørrelse og effektstørrelse. Husk til slutt: p-verdien sier ikke hvor sannsynlig er, og statistisk signifikans er ikke det samme som praktisk betydning.
Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.