Tilbake
4.2

4.2 Type I- og Type II-feil, power og utvalgsstørrelse

De to feilbeslutningene og balansen mellom dem — med power som det stigende A-temaet: hvorfor større utvalg gjør det lettere å avsløre en falsk H0.

55 min
4 oppgaver
Type I-Type II-feilpowerutvalgsstørrelse
Din fremgang i kapitlet
0 / 4 oppgaver
Forkunnskaper. Dette kapitlet bygger på kap. 4.1 (hypoteser, α, beslutningsregelen) og kap. 3.3 (standardfeil og hvordan n påvirker den).

Sist du var her (nøkkelbegrepene oppfrisket):

- α\alpha = signifikansnivået = terskelen p sammenlignes mot, og risikoen for å forkaste en sann H0H_0 (fra 4.1).
- Beslutningsregelen: forkast H0H_0 hvis pαp \leq \alpha (fra 4.1).
- SE=SDnSE = \dfrac{SD}{\sqrt{n}}: standardfeilen krymper når nn vokser (fra 3.3) — dette er nøkkelen til power.

Her ser vi på hva som kan gå galt i en beslutning, og hvordan vi gjør det lettere å oppdage ekte effekter.

Løkke 1 — De to feilbeslutningene (~20 min)

Hverdagsanker. Tenk på en brannalarm. Den kan svikte på to måter: den kan ule uten at det brenner (falsk alarm — irriterende, unødvendig evakuering), eller den kan tie mens det brenner (den oversette brannen — potensielt katastrofalt). En perfekt alarm gjør ingen av delene, men i praksis må vi balansere de to risikoene mot hverandre.

En hypotesetest står overfor nøyaktig de samme to feilene. Vi vet aldri sikkert om H0H_0 egentlig er sann eller ikke, så beslutningen vår (forkaste eller beholde) kan bomme på to måter.

Type I-feil (falsk alarm)

En Type I-feil er å forkaste en sann H0H_0 — å konkludere med at det finnes en effekt når det i virkeligheten ikke gjør det. Dette er alarmen som uler uten at det brenner.

Risikoen for en Type I-feil er nettopp α\alpha (signifikansnivået). Setter vi α=0,05\alpha = 0{,}05, godtar vi 5 % sjanse for falsk alarm hver gang H0H_0 faktisk er sann. Vil vi ha færre falske alarmer, senker vi α\alpha (til 0,01) — men det har en pris (se Type II).

Type II-feil (oversett effekt)

En Type II-feil er å beholde en falsk H0H_0 — å overse en effekt som faktisk finnes. Dette er alarmen som tier mens det brenner.

Risikoen for en Type II-feil kalles β\beta (den greske bokstaven «beta»). β\beta avhenger av tre ting: hvor stor den ekte effekten er, hvor stort utvalget (nn) er, og hvilket α\alpha vi valgte. Vi kan ikke lese β\beta direkte av α — de to feiltypene henger sammen via en avveining.

📝Oppgave 4.2.1
(Eksamenssjanger T2 — hypotesetestingsoppgaven. Lett innstegsoppgave: gjenkjenn feiltypen.)

En forsker tester en ny medisin. I virkeligheten virker medisinen ikke (H0H_0 er sann), men testen gir p=0,03p = 0{,}03, og forskeren konkluderer at den virker.

a) Hvilken feiltype er dette?
b) Hvilken risiko (symbol) styrer hvor ofte en slik feil skjer?

📝Oppgave 4.2.2
(Eksamenssjanger T2 — den andre feiltypen.)

En annen medisin virker faktisk (H0H_0 er falsk), men studien er liten og gir p=0,20p = 0{,}20, så forskeren beholder H0H_0 og konkluderer at medisinen ikke virker.

a) Hvilken feiltype er dette?
b) Hva heter risikoen for en slik feil, og hva er power uttrykt ved den?

Løkke 2 — Beslutningsmatrisen og avveiningen (~18 min)

— naturlig pausepunkt —

📜Beslutningsmatrisen (2×2)

Alle fire utfall av en test kan settes i en tabell — sannhet (rad) mot beslutning (kolonne):

H0 er sann (ingen effekt)H0 er falsk (ekte effekt)
Forkast H0❌ Type I-feil (risiko α\alpha)✔ Riktig (power =1β= 1-\beta)
Behold H0✔ Riktig❌ Type II-feil (risiko β\beta)

De to riktige rutene ligger på diagonalen. De to feilene ligger på motdiagonalen: Type I øverst til venstre (så noe som ikke var der), Type II nederst til høyre (overså noe som var der). Figuren under viser den samme matrisen med feil-cellene fargekodet. Å kunne tegne og tolke denne tabellen er selve kjernen i deloppgaven.

Power (statistisk styrke)
Power er sannsynligheten for å forkaste H0H_0 når H0H_0 faktisk er falsk — altså for å oppdage en ekte effekt:

power=1β\text{power} = 1 - \beta

Konvensjonen er 80 % power (β = 0,20). En test med lav power vil ofte overse ekte effekter (mange Type II-feil). Power øker med (i) større ekte effekt, (ii) større utvalg nn, og (iii) et mildere (større) α\alpha. Merk at 80 %-konvensjonen aksepterer en langt høyere feilrisiko for Type II (β=0,20\beta = 0{,}20) enn for Type I (α=0,05\alpha = 0{,}05) — falsk alarm regnes vanligvis som mer alvorlig enn en oversett effekt.

Avveiningen mellom feiltypene. De to feilene trekker mot hverandre. Senker du α\alpha (færre falske alarmer, færre Type I-feil), gjør du det samtidig vanskeligere å forkaste H0H_0 — så du overser flere ekte effekter (flere Type II-feil, høyere β\beta). Du kan ikke minimere begge samtidig ved bare å skru på α\alpha.

Hvilken feil er verst? Det avhenger av konteksten. Ved screening for en alvorlig sykdom er en oversett sykdom (Type II) verst — man vil heller ha noen falske alarmer. Ved godkjenning av et nytt medikament er det motsatt: å godkjenne noe virkningsløst (Type I) kan være farligere. En A-besvarelse drøfter dette i lys av det konkrete scenariet, ikke abstrakt.

📝Oppgave 4.2.3
(Eksamenssjanger T2 — anvend feiltypene på et konkret scenario (A-krav: hva hver feil BETYR her).)

En ny behandling mot flyskrekk testes mot ingen behandling. H0H_0: behandlingen har ingen effekt.

a) Hva ville en Type I-feil bety konkret i denne studien?
b) Hva ville en Type II-feil bety konkret?
c) Hvis behandlingen er billig og ufarlig, hvilken feil er da mest bekymringsfull? Begrunn.

Løkke 3 — Power og utvalgsstørrelse: V2024-leddet (~17 min)

— naturlig pausepunkt —

Hvorfor større utvalg gir mer power. Dette er kjeden V2024 spurte om som egen deloppgave, og den henger direkte på standardfeilen fra kap. 3.3:

større n    mindre SE=SDn    samme ekte effekt gir større testobservator    lettere a˚ forkaste en falsk H0    høyere power\text{større } n \;\Rightarrow\; \text{mindre } SE = \frac{SD}{\sqrt{n}} \;\Rightarrow\; \text{samme ekte effekt gir større testobservator} \;\Rightarrow\; \text{lettere å forkaste en falsk } H_0 \;\Rightarrow\; \text{høyere power}

Med et større utvalg blir utvalgsfordelingen smalere. En ekte forskjell som «drukner i støyen» ved lite nn, stikker tydelig fram når SESE er liten. Å doble utvalget reduserer SESE med faktoren 1/20,711/\sqrt{2} \approx 0{,}71 — presisjonen øker, men langsommere enn utvalget vokser (√-effekten).

✏️Eksempel — hvorfor en kollega vil doble utvalget

En pilotstudie (n=25n = 25 per gruppe) finner en liten, men ekte forskjell mellom to grupper. Resultatet blir ikke signifikant (p = 0,14). En kollega foreslår å gjenta studien med dobbelt så mange deltakere. Forklar hva doblingen gjør, og hvorfor det hjelper.

Effekten er ekte (H0 er egentlig falsk), men pilotstudien overså den — en Type II-feil, fordi lav nn ga stor SESE og dermed en liten testobservator og stor p.

Hva doblingen gjør: flere deltakere gir mindre standardfeil. Med SE=SD/nSE = SD/\sqrt{n} reduseres SESE med faktoren 1/20,711/\sqrt{2} \approx 0{,}71 når nn dobles. Samme ekte forskjell deles nå på et mindre tall og gir en større testobservator — altså en mindre p-verdi.

Tolkning i ord: doblingen øker studiens power (1 − β) — sjansen for å oppdage den ekte effekten. Den endrer ikke den ekte effektstørrelsen eller SD, bare presisjonen vi måler den med. Derfor er kollegaens forslag fornuftig: en større studie har bedre sjanse til å avsløre en falsk H0H_0.

📝Oppgave 4.2.4
(Eksamenssjanger T2 — power-leddet, mønsterklon av V2024 (krevende).)

Et forskerteam finner en ikke-signifikant forskjell mellom to studieteknikker og lurer på om de bør øke utvalget.

a) Definer power, uttrykt ved β.
b) Forklar kjeden fra 'større n' til 'høyere power'. Bruk SE=SDn\displaystyle SE = \frac{SD}{\sqrt{n}}.
c) Nevn tre ting som påvirker power, og si hvilken av dem forskerne faktisk kan styre her.

Begrepsbank — feiltyper og power

Flashcard-/repetisjonsstoff — hopp trygt over ved førstegangslesing; tidsanslaget over gjelder kjernestoffet.

Type I ↔ Type II (kontrastpar)
Type I: forkaste en sann H0H_0 (falsk alarm, risiko α\alpha) — ser noe som ikke er der. Type II: beholde en falsk H0H_0 (oversett effekt, risiko β\beta) — ser ikke noe som er der. De er hverandres speilbilder over beslutningsmatrisens diagonal.
α ↔ β (kontrastpar)
α\alpha = Type I-risiko, gjelder når H0H_0 er sann, velges av forskeren (ofte 0,05). β\beta = Type II-risiko, gjelder når H0H_0 er falsk, følger av effektstørrelse, nn og α. De summerer IKKE til 1.
Power = 1 − β

Power er sannsynligheten for å oppdage en ekte effekt (forkaste en falsk H0H_0). power=1β\text{power} = 1 - \beta. Konvensjonen er 80 % power, altså β=0,20\beta = 0{,}20.

Falsk alarm

Dagligtale for Type I-feil: testen roper «effekt!» når det ikke er noen. Risikoen er α. Analogien: brannalarmen uler uten røyk.

Oversett effekt

Dagligtale for Type II-feil: testen tier når det faktisk er en effekt. Risikoen er β. Analogien: brannalarmen overser brannen.

Beslutningsmatrisen

2×2-tabellen sannhet (H0 sann/falsk) × beslutning (forkast/behold). Riktige utfall på diagonalen; Type I og Type II på motdiagonalen. Å tegne den er kjernen i deloppgaven.

Power-determinant: effektstørrelse

Jo større den ekte effekten er, desto lettere er den å oppdage — høyere power. En bitteliten ekte effekt krever stort utvalg for å bli sett. Effektstørrelsen i naturen kan forskeren ikke styre.

Power-determinant: utvalgsstørrelse n

Større nn ⟹ mindre SE=SD/nSE = SD/\sqrt{n} ⟹ smalere utvalgsfordeling ⟹ ekte effekter stikker tydeligere fram ⟹ høyere power. Dette er faktoren forskeren lettest kan styre — et fast deloppgaveledd på eksamen.

Power-determinant: α

Et mildere (større) α\alpha gjør det lettere å forkaste H0H_0 og øker power — men på bekostning av flere Type I-feil. Et strengere α (0,01) senker Type I-risikoen, men øker β.

Avveiningen α mot β

Senker du α\alpha (færre Type I-feil), øker du β\beta (flere Type II-feil), alt annet likt. Du kan ikke minimere begge feiltypene bare ved å justere α — det krever mer data (større n).

80 %-konvensjonen

Standarden er 80 % power (β=0,20\beta = 0{,}20). Den godtar en langt høyere risiko for Type II (20 %) enn for Type I (5 %), fordi en falsk alarm ofte regnes som mer alvorlig enn en oversett effekt — men dette er en konvensjon, ikke en naturlov.

Hvilken feil er verst?

Kontekstavhengig. Ved screening for alvorlig sykdom er Type II (oversett sykdom) verst; ved medikamentgodkjenning er Type I (godkjenne noe virkningsløst) ofte verst. En A-besvarelse begrunner ut fra scenariets kostnader.

SD vs. SE i power-sammenheng

Større nn reduserer SESE (presisjonen i gjennomsnittet), IKKE SDSD (den ekte spredningen mellom personer). Det er fallende SESE som løfter power. Å tro n krymper SD er en fast felle.

√n-effekten på power

Doblet utvalg reduserer SESE med bare 1/20,711/\sqrt{2} \approx 0{,}71 — presisjon (og power) øker, men langsommere enn nn vokser. Å firedoble nn halverer SESE. Presisjon er «dyr».

H0 sann vs. falsk styrer feiltypen

Nøkkelen til å skille feiltypene: spør først om H0H_0 i virkeligheten er sann eller falsk. Feil ved sann H0H_0 = Type I; feil ved falsk H0H_0 = Type II. Uten dette utgangspunktet blander man dem (feil #2).

Repetisjon — pensumkart for 4.2
Symbol- og formelliste

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.

Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Universitetet i Oslo. Dette er ikke offisielt studiemateriell. Innholdet er læringsstoff, ikke helse- eller medisinske råd. Les mer.