Tilbake
5.3
Feiltyper og teststyrke

5.3 Feiltyper og teststyrke

Type I og type II feil, teststyrke.

45 min
17 oppgaver
Type I feilType II feilTeststyrkeUtvalgsstørrelse
Du leser den tradisjonelle versjonen
Din fremgang i kapitlet
0 / 17 oppgaver
Kapitlets plass i kurset

To typer feil i hypotesetesting

Når vi tar en beslutning basert på en hypotesetest, kan vi gjøre feil. Siden vi baserer oss på et utvalg (ikke hele populasjonen), er det alltid en risiko for å trekke feil konklusjon.

Det finnes to typer feil:

H0H_0 er sannH0H_0 er usann
Forkaster H0H_0Type I feilRiktig beslutning
Forkaster ikke H0H_0Riktig beslutningType II feil
Type I feil (falsk positiv)
En Type I feil oppstår når vi forkaster en sann nullhypotese.

Sannsynligheten for Type I feil er lik signifikansnivået:
P(Type I feil)=αP(\text{Type I feil}) = \alpha

Eksempel: Vi konkluderer med at en medisin har effekt, men i virkeligheten har den ikke det.

Type I feil kalles også falsk alarm eller falsk positiv.

Type II feil (falsk negativ)
En Type II feil oppstår når vi ikke forkaster en usann nullhypotese.

Sannsynligheten for Type II feil betegnes:
P(Type II feil)=βP(\text{Type II feil}) = \beta

Eksempel: Vi konkluderer med at medisinen ikke har effekt, men i virkeligheten virker den.

Type II feil kalles også glipp eller falsk negativ.

β\beta avhenger av den sanne verdien av parameteren (som vi ikke kjenner), og kan derfor ikke settes direkte som α\alpha kan.

Teststyrke (power)

Teststyrken er sannsynligheten for å forkaste H0H_0 når H0H_0 faktisk er usann:

Teststyrke=1β=P(forkaste H0H0 er usann)\text{Teststyrke} = 1 - \beta = P(\text{forkaste } H_0 \mid H_0 \text{ er usann})

En høy teststyrke betyr at testen er god til å oppdage virkelige effekter.

Tommelfingerregel: Teststyrken bør være minst 0,80 (80 %). Det betyr at vi oppdager en virkelig effekt i minst 80 % av tilfellene.

📜Teststyrke for z-test
For en ensidig test H0:μ=μ0H_0: \mu = \mu_0 mot H1:μ>μ0H_1: \mu > \mu_0 med signifikansnivå α\alpha:

Styrke=P(Z>zαμ1μ0σ/n)\text{Styrke} = P\left(Z > z_\alpha - \frac{\mu_1 - \mu_0}{\sigma/\sqrt{n}}\right)

der μ1\mu_1 er den sanne verdien av μ\mu under H1H_1.

For en tosidig test er formelen mer kompleks, men prinsippet er det samme.

✏️Beregning av teststyrke

Vi tester H0:μ=100H_0: \mu = 100 mot H1:μ>100H_1: \mu > 100 med α=0,05\alpha = 0{,}05, n=36n = 36, og σ=12\sigma = 12. Hva er teststyrken hvis den sanne verdien er μ1=104\mu_1 = 104?

Kritisk verdi: z0,05=1,645z_{0{,}05} = 1{,}645

Beregning:
Styrke=P(Z>1,64510410012/36)=P(Z>1,64542)=P(Z>0,355)\text{Styrke} = P\left(Z > 1{,}645 - \frac{104 - 100}{12/\sqrt{36}}\right) = P\left(Z > 1{,}645 - \frac{4}{2}\right) = P(Z > -0{,}355)

=1P(Z<0,355)=10,361=0,639= 1 - P(Z < -0{,}355) = 1 - 0{,}361 = 0{,}639

Teststyrken er 63,9 %. Det betyr at vi bare oppdager effekten i omtrent 64 % av tilfellene - noe lavt!

Sammenheng mellom α\alpha, β\beta og nn

De tre faktorene påvirker hverandre:

1. Øke α\alpha (signifikansnivå):
- Lettere å forkaste H0H_0
- β\beta reduseres → styrken øker
- Men risikoen for Type I feil øker

2. Øke nn (utvalgsstørrelse):
- Både α\alpha og β\beta kan holdes lave
- Styrken øker
- Men koster mer (tid, penger)

3. Stor effektstørrelse (avvik fra H0H_0):
- Lettere å oppdage → styrken øker
- Men vi kontrollerer ikke effektstørrelsen

Oppsummering:
- α\alpha og β\beta er i «konflikt»: å redusere den ene øker den andre (for fast nn)
- Den eneste måten å redusere begge samtidig er å øke nn

✏️Nødvendig utvalgsstørrelse for gitt styrke

Vi ønsker å teste H0:μ=100H_0: \mu = 100 mot H1:μ>100H_1: \mu > 100 med α=0,05\alpha = 0{,}05 og styrke =0,80= 0{,}80. Vi antar at den sanne verdien er μ1=105\mu_1 = 105 og σ=15\sigma = 15. Finn nødvendig utvalgsstørrelse.

For ensidig test med styrke 1β1 - \beta:

n=((zα+zβ)σμ1μ0)2n = \left(\frac{(z_\alpha + z_\beta) \cdot \sigma}{\mu_1 - \mu_0}\right)^2

Innsetting: z0,05=1,645z_{0{,}05} = 1{,}645 og z0,20=0,842z_{0{,}20} = 0{,}842 (fra β=0,20\beta = 0{,}20)

n=((1,645+0,842)15105100)2=(2,487155)2=(7,461)2=55,7n = \left(\frac{(1{,}645 + 0{,}842) \cdot 15}{105 - 100}\right)^2 = \left(\frac{2{,}487 \cdot 15}{5}\right)^2 = \left(7{,}461\right)^2 = 55{,}7

Vi trenger n56n \geq 56 observasjoner.

Praktisk vs. statistisk signifikans

Et resultat kan være statistisk signifikant uten å være praktisk viktig, og omvendt.

Eksempel: En studie med n=10000n = 10\,000 finner at en ny medisin senker blodtrykket med 0,5 mmHg (p-verdi < 0,001). Resultatet er statistisk signifikant, men en forskjell på 0,5 mmHg har neppe noen klinisk betydning.

Omvendt: En liten studie med n=20n = 20 finner at en behandling reduserer smerter med 40 % (p-verdi = 0,08). Resultatet er ikke statistisk signifikant, men effekten er potensielt klinisk viktig - problemet er for lite utvalg.

Konfidensintervall hjelper: De viser både estimert effekt (praktisk størrelse) og usikkerhet (statistisk). Rapporter alltid konfidensintervall i tillegg til p-verdier.

📝Oppgave 1

Løs oppgavene:

a

Forklar med egne ord hva en Type I feil er.

b

Forklar med egne ord hva en Type II feil er.

📝Oppgave 2

Løs oppgavene:

a

En brannalarm kan gi falsk alarm eller ikke varsle ved en ekte brann. Hvilken er Type I feil, og hvilken er Type II feil?

📝Oppgave 3

Løs oppgavene:

a

Hva er teststyrken, og hva er en god tommelfingerregel for styrke?

📝Oppgave 4

Løs oppgavene:

a

Et rettssystem kan gjøre to typer feil: dømme en uskyldig (Type I) eller frikjenne en skyldig (Type II). Forklar hvorfor rettssystemet har lavt α\alpha («hevet over enhver rimelig tvil»).

📝Oppgave 5

Løs oppgavene:

a

Hva skjer med teststyrken dersom vi øker utvalgsstørrelsen nn? Forklar intuitivt.

📝Oppgave 6

Løs oppgavene:

a

Vi tester H0:μ=50H_0: \mu = 50 mot H1:μ>50H_1: \mu > 50 med α=0,05\alpha = 0{,}05, n=25n = 25, σ=10\sigma = 10. Finn teststyrken dersom μ1=54\mu_1 = 54.

📝Oppgave 7

Løs oppgavene:

a

Med samme parametre som oppgave 6, men n=100n = 100, finn teststyrken.

📝Oppgave 8

Løs oppgavene:

a

Forklar hvorfor man ikke kan redusere både α\alpha og β\beta uten å endre noe annet.

📝Oppgave 9

Løs oppgavene:

a

Finn nødvendig nn for å teste H0:μ=200H_0: \mu = 200 mot H1:μ>200H_1: \mu > 200 med α=0,05\alpha = 0{,}05, styrke =0,90= 0{,}90 og σ=30\sigma = 30 dersom vi ønsker å oppdage μ1=210\mu_1 = 210.

📝Oppgave 10

Løs oppgavene:

a

En studie med n=50000n = 50\,000 finner at en medisin senker kolesterolet med 0,1 mg/dL (p-verdi <0,001< 0{,}001). Klinisk relevant forskjell er minst 5 mg/dL. Diskuter statistisk vs. praktisk signifikans.

📝Oppgave 11

Løs oppgavene:

a

I en medisinsk studie er konsekvensene av Type I og Type II feil ulike. Forklar hva som er konsekvensene av hver feiltype når man tester en ny behandling, og diskuter hvordan man bør velge α\alpha.

📝Oppgave 12

Løs oppgavene:

a

Forklar hva som menes med «effektstørrelse» og hvorfor denne er viktig i tillegg til p-verdien. Gi et eksempel.

Oppsummering

Læringspunkter:
- Type I-feil: å forkaste en sann H0H_0 (falsk positiv). Sannsynligheten er signifikansnivået α\alpha.
- Type II-feil: å beholde en gal H0H_0 (falsk negativ). Sannsynligheten kalles β\beta.
- Teststyrken er 1β1 - \beta: sannsynligheten for å avsløre en reell effekt. Tommelfingerregel: styrke 0,8\geq 0{,}8.
- Styrken øker med større utvalg, større reell effekt, større α\alpha og mindre spredning.
- α\alpha og β\beta trekker i hver sin retning: senkes α\alpha (strengere test), øker β\beta — med mindre nn økes.

NøkkelbegrepForklaring
Type I-feilForkaste sann H0H_0 — sannsynlighet α\alpha
Type II-feilBeholde gal H0H_0 — sannsynlighet β\beta
Teststyrke1β1 - \beta: sjansen for å oppdage en reell effekt
EffektstørrelseHvor stort det reelle avviket fra H0H_0 er

Viktige formler:
P(Type I)=α,Styrke=1βP(\text{Type I}) = \alpha, \qquad \text{Styrke} = 1 - \beta
n((zα+zβ)σδ)2(ensidig test, effekt δ)n \approx \left(\frac{(z_{\alpha} + z_{\beta})\,\sigma}{\delta}\right)^2 \quad (\text{ensidig test, effekt } \delta)
Repetisjonsoppgaver
Din fremgang
0deloppgaver0 / 5 oppgaver

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.