Uavhengig og paret t-test, kjikvadratstest for uavhengighet.
Riktig verktøy til riktig data
Du har et spørsmål og noen data, og du vil vite om forskjellen du ser er ekte. Men hvilken statistisk test skal du bruke? Svaret avhenger av hva slags data du har og hvordan studien er lagt opp. I dette kapittelet møter du tre av de mest brukte testene -- og det viktigste er å forstå når hver passer.
Vi starter med den uavhengige t-testen, som sammenligner gjennomsnittene i to uavhengige grupper. «Uavhengige» betyr at deltakerne i den ene gruppa ikke er koblet til den andre. Den passer når du sammenligner to klasser med ulike undervisningsmetoder, en medikamentgruppe mot en placebogruppe, eller reaksjonstid hos kvinner mot menn. Men testen hviler på noen forutsetninger: observasjonene må være uavhengige, dataene tilnærmet normalfordelte (eller per gruppe), og gruppene bør ha omtrent lik spredning.
Selve teststatistikken ser slik ut: , der er det sammenslåtte standardavviket. Telleren er forskjellen mellom gruppene, og nevneren er usikkerheten -- så stor forskjell og liten usikkerhet gir høy t-verdi. Antall frihetsgrader er . Sammenligner du to studieteknikker med 78 mot 72 poeng og standardavvik rundt 8-10 hos 15 elever i hver gruppe, kan du regne deg fram til , som er under den kritiske verdien -- altså ikke signifikant.
Når hver person er sin egen kontroll
Den parede t-testen brukes når de to settene med målinger er koblet sammen -- som regel fordi det er de samme personene målt to ganger. Tenk på blodtrykk før og etter en behandling hos de samme pasientene, eller testresultater for de samme elevene på to tidspunkter. Genialiteten ligger i at hver person blir sin egen kontroll: individuelle forskjeller som ulik utgangspuls eller ulik motivasjon forsvinner automatisk, fordi vi bare ser på endringen for hver enkelt.
Derfor regner vi ikke på gruppene direkte, men på differansen for hvert par. Så kjører vi en t-test på differansene: , med . Si at åtte pasienter får blodtrykksdifferanser på . Gjennomsnittet blir , standardavviket til differansene blir omtrent , og da får vi . Det er langt forbi den kritiske verdien, så behandlingen gir en klart signifikant reduksjon.
Det kritiske valget er altså: er gruppene uavhengige (to forskjellige sett mennesker) eller parede (samme mennesker to ganger)? Måler du stress hos de samme 30 ansatte før og etter et kurs, er det paret t-test -- ikke uavhengig.
Når dataene er kategorier
Begge t-testene krever kvantitative tall. Men hva om dataene dine er kategorier -- kjønn, ja/nei, programfag, utdanningsnivå? Da trenger du kjikvadratstesten (-testen). Den tester om det er en sammenheng mellom to kategoriske variabler.
Idéen er elegant: vi sammenligner det vi faktisk ser (observerte frekvenser, ) med det vi ville forventet hvis det ikke var noen sammenheng (forventede frekvenser, ). Teststatistikken er , der vi summerer over hver celle i krysstabellen. Den forventede frekvensen finner vi med , og frihetsgradene er , der er rader og er kolonner. En tommelregel er at forventet frekvens i hver celle bør være minst 5.
Si at du undersøker om kjønn henger sammen med valg av programfag blant 200 elever. Hvis 60 gutter velger realfag mens forventet er 52,5, og du regner ut alle cellene, kan du ende på . Med er kritisk verdi , og siden forkaster du -- det er en signifikant sammenheng. En stor -verdi betyr stort avvik mellom det observerte og det forventede.
En siste advarsel om valg av test: vil du sammenligne gjennomsnitt i tre eller flere grupper, skal du ikke kjøre flere t-tester etter hverandre. Da hoper risikoen for type I-feil seg opp -- tre tester med gir samlet rundt 14 % falsk-positiv-risiko. I stedet bruker du ANOVA (variansanalyse).
Oppsummering
Vi har møtt tre statistiske arbeidshester. Uavhengig t-test (, ) sammenligner gjennomsnitt i to uavhengige grupper. Paret t-test (, ) sammenligner gjentatte målinger på de samme individene, der hver person er sin egen kontroll. Kjikvadratstesten (, ) tester sammenheng mellom to kategoriske variabler.
Det viktigste er å velge riktig test: t-test for kvantitative data, kjikvadrat for kategoriske; uavhengig for ulike grupper, paret for samme gruppe to ganger; og ANOVA når du har tre eller flere grupper. Alle testene krever at forutsetningene er oppfylt for at resultatet skal være gyldig.
Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.