Tilbake
5.3
Feiltyper og teststyrke

5.3 Feiltyper og teststyrke

Type I og type II feil, teststyrke.

45 min
17 oppgaver
Type I feilType II feilTeststyrkeUtvalgsstørrelse
Du leser den tradisjonelle versjonen
Din fremgang i kapitlet
0 / 17 oppgaver
Kapitlets plass i kurset

To typar feil i hypotesetesting

Når vi tek ei avgjerd basert på ein hypotesetest, kan vi gjere feil. Sidan vi baserer oss på eit utval (ikkje heile populasjonen), er det alltid ein risiko for å trekkje feil konklusjon.

Det finst to typar feil:

H0H_0 er sannH0H_0 er usann
Forkastar H0H_0Type I-feilRett avgjerd
Forkastar ikkje H0H_0Rett avgjerdType II-feil
Type I-feil (falsk positiv)
Ein Type I-feil oppstår når vi forkastar ein sann nullhypotese.

Sannsynet for Type I-feil er lik signifikansnivået:
P(Type I feil)=αP(\text{Type I feil}) = \alpha

Døme: Vi konkluderer med at ein medisin har effekt, men i røyndomen har han ikkje det.

Type I-feil blir òg kalla falsk alarm eller falsk positiv.

Type II-feil (falsk negativ)
Ein Type II-feil oppstår når vi ikkje forkastar ein usann nullhypotese.

Sannsynet for Type II-feil blir nemnt:
P(Type II feil)=βP(\text{Type II feil}) = \beta

Døme: Vi konkluderer med at medisinen ikkje har effekt, men i røyndomen verkar han.

Type II-feil blir òg kalla glipp eller falsk negativ.

β\beta avheng av den sanne verdien av parameteren (som vi ikkje kjenner), og kan difor ikkje setjast direkte slik α\alpha kan.

Teststyrke (power)

Teststyrken er sannsynet for å forkaste H0H_0 når H0H_0 faktisk er usann:

Teststyrke=1β=P(forkaste H0H0 er usann)\text{Teststyrke} = 1 - \beta = P(\text{forkaste } H_0 \mid H_0 \text{ er usann})

Ei høg teststyrke tyder at testen er god til å oppdage verkelege effektar.

Tommelfingerregel: Teststyrken bør vere minst 0,80 (80 %). Det tyder at vi oppdagar ein verkeleg effekt i minst 80 % av tilfella.

📜Teststyrke for z-test
For ein einsidig test H0:μ=μ0H_0: \mu = \mu_0 mot H1:μ>μ0H_1: \mu > \mu_0 med signifikansnivå α\alpha:

Styrke=P(Z>zαμ1μ0σ/n)\text{Styrke} = P\left(Z > z_\alpha - \frac{\mu_1 - \mu_0}{\sigma/\sqrt{n}}\right)

der μ1\mu_1 er den sanne verdien av μ\mu under H1H_1.

For ein tosidig test er formelen meir kompleks, men prinsippet er det same.

✏️Berekning av teststyrke

Vi testar H0:μ=100H_0: \mu = 100 mot H1:μ>100H_1: \mu > 100 med α=0,05\alpha = 0{,}05, n=36n = 36, og σ=12\sigma = 12. Kva er teststyrken dersom den sanne verdien er μ1=104\mu_1 = 104?

Kritisk verdi: z0,05=1,645z_{0{,}05} = 1{,}645

Berekning:
Styrke=P(Z>1,64510410012/36)=P(Z>1,64542)=P(Z>0,355)\text{Styrke} = P\left(Z > 1{,}645 - \frac{104 - 100}{12/\sqrt{36}}\right) = P\left(Z > 1{,}645 - \frac{4}{2}\right) = P(Z > -0{,}355)

=1P(Z<0,355)=10,361=0,639= 1 - P(Z < -0{,}355) = 1 - 0{,}361 = 0{,}639

Teststyrken er 63,9 %. Det tyder at vi berre oppdagar effekten i om lag 64 % av tilfella - noko lågt!

Samanheng mellom α\alpha, β\beta og nn

Dei tre faktorane påverkar kvarandre:

1. Auke α\alpha (signifikansnivå):
- Lettare å forkaste H0H_0
- β\beta blir redusert → styrken aukar
- Men risikoen for Type I-feil aukar

2. Auke nn (utvalsstorleik):
- Både α\alpha og β\beta kan haldast låge
- Styrken aukar
- Men kostar meir (tid, pengar)

3. Stor effektstorleik (avvik frå H0H_0):
- Lettare å oppdage → styrken aukar
- Men vi kontrollerer ikkje effektstorleiken

Oppsummering:
- α\alpha og β\beta er i «konflikt»: å redusere den eine aukar den andre (for fast nn)
- Den einaste måten å redusere begge samtidig er å auke nn

✏️Nødvendig utvalsstorleik for gitt styrke

Vi ønskjer å teste H0:μ=100H_0: \mu = 100 mot H1:μ>100H_1: \mu > 100 med α=0,05\alpha = 0{,}05 og styrke =0,80= 0{,}80. Vi antar at den sanne verdien er μ1=105\mu_1 = 105 og σ=15\sigma = 15. Finn nødvendig utvalsstorleik.

For einsidig test med styrke 1β1 - \beta:

n=((zα+zβ)σμ1μ0)2n = \left(\frac{(z_\alpha + z_\beta) \cdot \sigma}{\mu_1 - \mu_0}\right)^2

Innsetjing: z0,05=1,645z_{0{,}05} = 1{,}645 og z0,20=0,842z_{0{,}20} = 0{,}842 (frå β=0,20\beta = 0{,}20)

n=((1,645+0,842)15105100)2=(2,487155)2=(7,461)2=55,7n = \left(\frac{(1{,}645 + 0{,}842) \cdot 15}{105 - 100}\right)^2 = \left(\frac{2{,}487 \cdot 15}{5}\right)^2 = \left(7{,}461\right)^2 = 55{,}7

Vi treng n56n \geq 56 observasjonar.

Praktisk vs. statistisk signifikans

Eit resultat kan vere statistisk signifikant utan å vere praktisk viktig, og omvendt.

Døme: Ein studie med n=10000n = 10\,000 finn at ein ny medisin senkar blodtrykket med 0,5 mmHg (p-verdi < 0,001). Resultatet er statistisk signifikant, men ein skilnad på 0,5 mmHg har neppe noka klinisk betydning.

Omvendt: Ein liten studie med n=20n = 20 finn at ei behandling reduserer smerter med 40 % (p-verdi = 0,08). Resultatet er ikkje statistisk signifikant, men effekten er potensielt klinisk viktig - problemet er for lite utval.

Konfidensintervall hjelper: Dei viser både estimert effekt (praktisk storleik) og uvisse (statistisk). Rapporter alltid konfidensintervall i tillegg til p-verdiar.

📝Oppgave 1

Løys oppgåvene:

a

Forklar med eigne ord kva ein Type I-feil er.

b

Forklar med eigne ord kva ein Type II-feil er.

📝Oppgave 2

Løys oppgåvene:

a

Ein brannalarm kan gi falsk alarm eller ikkje varsle ved ein ekte brann. Kva for ein er Type I-feil, og kva for ein er Type II-feil?

📝Oppgave 3

Løys oppgåvene:

a

Kva er teststyrken, og kva er ein god tommelfingerregel for styrke?

📝Oppgave 4

Løys oppgåvene:

a

Eit rettssystem kan gjere to typar feil: dømme ein uskuldig (Type I) eller frikjenne ein skuldig (Type II). Forklar kvifor rettssystemet har lågt α\alpha («heva over kvar rimeleg tvil»).

📝Oppgave 5

Løys oppgåvene:

a

Kva skjer med teststyrken dersom vi aukar utvalsstorleiken nn? Forklar intuitivt.

📝Oppgave 6

Løys oppgåvene:

a

Vi testar H0:μ=50H_0: \mu = 50 mot H1:μ>50H_1: \mu > 50 med α=0,05\alpha = 0{,}05, n=25n = 25, σ=10\sigma = 10. Finn teststyrken dersom μ1=54\mu_1 = 54.

📝Oppgave 7

Løys oppgåvene:

a

Med same parametrar som oppgåve 6, men n=100n = 100, finn teststyrken.

📝Oppgave 8

Løys oppgåvene:

a

Forklar kvifor ein ikkje kan redusere både α\alpha og β\beta utan å endre noko anna.

📝Oppgave 9

Løys oppgåvene:

a

Finn nødvendig nn for å teste H0:μ=200H_0: \mu = 200 mot H1:μ>200H_1: \mu > 200 med α=0,05\alpha = 0{,}05, styrke =0,90= 0{,}90 og σ=30\sigma = 30 dersom vi ønskjer å oppdage μ1=210\mu_1 = 210.

📝Oppgave 10

Løys oppgåvene:

a

Ein studie med n=50000n = 50\,000 finn at ein medisin senkar kolesterolet med 0,1 mg/dL (p-verdi <0,001< 0{,}001). Klinisk relevant skilnad er minst 5 mg/dL. Diskuter statistisk vs. praktisk signifikans.

📝Oppgave 11

Løys oppgåvene:

a

I ein medisinsk studie er konsekvensane av Type I- og Type II-feil ulike. Forklar kva som er konsekvensane av kvar feiltype når ein testar ei ny behandling, og diskuter korleis ein bør velje α\alpha.

📝Oppgave 12

Løys oppgåvene:

a

Forklar kva som blir meint med «effektstorleik» og kvifor denne er viktig i tillegg til p-verdien. Gi eit døme.

Oppsummering

Læringspunkt:
- Type I-feil: å forkaste ein sann H0H_0 (falsk positiv). Sannsynet er signifikansnivået α\alpha.
- Type II-feil: å halde på ein gal H0H_0 (falsk negativ). Sannsynet blir kalla β\beta.
- Teststyrken er 1β1 - \beta: sannsynet for å avsløre ein reell effekt. Tommelfingerregel: styrke 0,8\geq 0{,}8.
- Styrken aukar med større utval, større reell effekt, større α\alpha og mindre spreiing.
- α\alpha og β\beta trekkjer i kvar si retning: blir α\alpha senka (strengare test), aukar β\beta — med mindre nn blir auka.

NøkkelomgrepForklaring
Type I-feilForkaste sann H0H_0 — sannsyn α\alpha
Type II-feilHalde på gal H0H_0 — sannsyn β\beta
Teststyrke1β1 - \beta: sjansen for å oppdage ein reell effekt
EffektstorleikKor stort det reelle avviket frå H0H_0 er

Viktige formlar:
P(Type I)=α,Styrke=1βP(\text{Type I}) = \alpha, \qquad \text{Styrke} = 1 - \beta
n((zα+zβ)σδ)2(einsidig test, effekt δ)n \approx \left(\frac{(z_{\alpha} + z_{\beta})\,\sigma}{\delta}\right)^2 \quad (\text{einsidig test, effekt } \delta)
Repetisjonsoppgåver
Din fremgang
0deloppgaver0 / 5 oppgaver

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.