Tilbake
4.1

4.1 H0, H1 og nullhypotesetestingens trinn

Å formulere hypoteser med μ-notasjon, kjøre trinnene i nullhypotesetesting — og definere p-verdien riktig: den ene feilen sensor har eksplisitt trekk-instruks for.

70 min
6 oppgaver
nullhypotesetestingens trinn
Din fremgang i kapitlet
0 / 6 oppgaver
Forkunnskaper. Dette kapitlet bygger på kap. 3.3 (utvalgsfordeling og standardfeil — selve motoren bak p-verdien) og kap. 3.4 (t som differanse målt i standardfeil). Kjenner du disse, har du halve kapitlet.

Sist du var her (nøkkelformlene oppfrisket):

- SE=SDnSE = \dfrac{SD}{\sqrt{n}} — standardfeilen: hvor mye et utvalgsgjennomsnitt typisk avviker fra populasjonssnittet (fra 3.3).
- Utvalgsfordelingen er fordelingen av tenkte gjentatte utvalgsgjennomsnitt; p-verdien leses fra den (fra 3.3).
- t=xˉ1xˉ2SE(D)t = \dfrac{\bar{x}_1 - \bar{x}_2}{SE(D)} — differansen målt i standardfeil; stor t|t| ⟹ liten p (fra 3.4).

Her setter vi ord på logikken rundt disse tallene: hva vi egentlig tester, og hva p faktisk betyr.

Løkke 1 — Hva vi egentlig tester: H0H_0, H1H_1 og μ (~18 min)

Hverdagsanker. Tenk deg en rettssak. Retten starter med en antakelse: tiltalte er uskyldig. Bare hvis bevisene er sterke nok, forkastes den antakelsen. Man beviser aldri uskyld — man klarer enten å tilbakevise den eller ikke.

Nullhypotesetesting fungerer på nøyaktig samme måte. Vi starter med en «uskyldsantakelse» — at det ikke er noen effekt (H0H_0) — og spør: er dataene så ekstreme at antakelsen blir vanskelig å tro på? Vi beviser aldri at det er en effekt; vi klarer enten å forkaste «ingen effekt» eller ikke.

Dette er logikken bak hver eneste hypotesetest. Vi bygger den ledd for ledd.

Nullhypotese (H0) og alternativhypotese (H1)
Nullhypotesen H0H_0 er påstanden om at det ikke finnes noen effekt eller forskjell i populasjonen — «uskyldsantakelsen». Det er H0H_0 som testes.

Alternativhypotesen H1H_1 (også skrevet HaH_a) er forskerens egentlige påstand: at det finnes en effekt eller forskjell.

Hypotesene handler alltid om populasjonsgjennomsnittet μ\mu (den greske bokstaven «my», uttales /myː/), ikke om utvalget vi målte. Eksempel for én gruppe mot en kjent norm μ0\mu_0:

H0:μ=μ0H1:μμ0H_0: \mu = \mu_0 \qquad H_1: \mu \neq \mu_0

Vi tester altså en påstand om hele populasjonen ved hjelp av ett utvalg.

Hvorfor μ og ikke utvalgssnittet? Utvalgssnittet (xˉ\bar{x}) vet vi allerede — vi har jo regnet det ut. Å teste en påstand om et tall vi kjenner, gir ingen mening. Poenget med en test er å slutte fra det vi ser (utvalget) til det vi ikke ser (populasjonen μ\mu). Å formulere hypotesen om utvalget er en fast eksamensfelle (feil #12 — vi glosser feilkodene ved første bruk; hele registeret står i kap. 8.6).
📝Oppgave 4.1.1
(Eksamenssjanger T2 — hypotesetestingsoppgaven. Lett innstegsoppgave: bare formulere hypotesene.)

En konsentrasjonstest er normert slik at befolkningsgjennomsnittet er μ0=50\mu_0 = 50. En forsker vil undersøke om en gruppe som har fått koffein, skårer annerledes enn normen — uten å ha en formening om retning på forhånd.

a) Skriv H0H_0 og H1H_1 med μ-notasjon.
b) Hva er det som faktisk testes, H0H_0 eller H1H_1?

Tohalet og enhalet test

En tohalet (toveis) test har ikke-retningsbestemt H1:μμ0H_1: \mu \neq \mu_0 — den fanger avvik i begge retninger. Dette er standardvalget.

En enhalet (enveis) test har retningsbestemt H1:μ>μ0H_1: \mu > \mu_0 (eller <<) — den ser bare etter avvik i én retning. Enhalet test er mer «sjenerøs» (lettere å få signifikans), men krever en faglig begrunnelse for retningen på forhånd — ellers er den en felle (feil #11). Å velge enhalet etter å ha sett dataene er ikke tillatt.

For samme resultat er enhalet p halvparten av den tohalede — forutsatt at effekten går i den predikerte retningen: er tohalet p=0,072p = 0{,}072, er enhalet p=0,036p = 0{,}036. (Går effekten motsatt vei av prediksjonen, gjelder ikke halveringen.)

📝Oppgave 4.1.2
(Eksamenssjanger T2 — en-/tohalet-skillet, differensieringsledd V2024.)

En forsker har god teoretisk grunn til å tro at et nytt lesetreningsopplegg gir høyere skår enn normen μ0=100\mu_0 = 100, og formulerer en retningsbestemt hypotese.

a) Skriv H0H_0 og H1H_1.
b) Er dette lov? Hva må til for at en enhalet test skal være tillatt?

Løkke 2 — Trinnene i en nullhypotesetest (~16 min)

— naturlig pausepunkt —

📜De fem trinnene i nullhypotesetesting

Hver hypotesetest følger de samme trinnene:

1. Formuler hypotesene H0H_0 og H1H_1 om populasjonen (μ\mu) — velg to- eller enhalet (sistnevnte krever begrunnelse).
2. Velg signifikansnivå α\alpha (den greske bokstaven «alfa») — konvensjonelt 0,050{,}05, av og til det strengere 0,010{,}01. α\alpha er hvor stor risiko for falsk alarm vi godtar.
3. Velg og utfør testen (t-test, ANOVA … — hvilken kommer i kap. 4.3) og beregn testobservatoren.
4. Finn p-verdien — sannsynligheten for et minst like ekstremt resultat gitt at H0H_0 er sann (leses fra utvalgsfordelingen).
5. Konkluder: forkast H0H_0 hvis pαp \leq \alpha; behold ellers. En forkastning betyr «effekten er trolig ekte»; å beholde H0H_0 er ikke bevis for at effekten mangler.

På eksamen oppgis som regel p — jobben din er trinn 1, 2 og 5, og å tolke riktig.

Hvorfor logikken er indirekte. Legg merke til at vi aldri regner ut «sannsynligheten for at H1H_1 er sann». Vi antar H0H_0, ser hvor rart resultatet blir under den antakelsen, og forkaster H0H_0 hvis det blir rart nok. Det er en bevisføring ved selvmotsigelse: «hvis det ikke var noen effekt, ville dette resultatet vært svært usannsynlig — altså tror vi det er en effekt». Denne indirektheten er kilden til de fleste tolkningsfeilene i neste løkke.
📝Oppgave 4.1.3
(Eksamenssjanger T2 — gjør rede for trinnene, standardledd i 19 av 29 sett.)

Et utvalg på n=64n = 64 tar en normert stresstest der befolkningssnittet er μ0=50\mu_0 = 50 og SD=8SD = 8. Utvalget får gjennomsnitt xˉ=52\bar{x} = 52. Bruk SE=SDn\displaystyle SE = \frac{SD}{\sqrt{n}}.

a) Formuler H0H_0 og H1H_1 (tohalet).
b) Regn ut SESE, og forklar hvorfor SESE er relevant her.
c) Sett opp de fem trinnene og si hva som gjenstår før du kan konkludere.

Løkke 3 — p-verdien: den ene definisjonen som må sitte (~20 min)

— naturlig pausepunkt — dette er kapitlets viktigste del —

p-verdien (korrekt definisjon)
p-verdien er sannsynligheten for å få et resultat minst like ekstremt som det observerte, GITT at H0H_0 er sann.

Legg merke til den siste leddet — «gitt at H0H_0 er sann». p er en sannsynlighet regnet ut under antakelsen om at nullhypotesen stemmer. Den sier hvor overraskende dataene er i en verden uten effekt. Figuren under viser tanken: utvalgsfordelingen tegnes sentrert på det H0H_0 forutsier, og p er haleområdet — hvor mye av fordelingen som ligger minst like langt ute som det observerte resultatet.

p er ikke sannsynligheten for at H0H_0 er sann, og ikke sannsynligheten for at H0H_0 er feil. Hypotesen er enten sann eller ikke — det er dataene som er tilfeldige, ikke hypotesen. p måler hvor rare dataene er hvis H0H_0 holder.

📝Oppgave 4.1.4
(Eksamenssjanger T2 — p-definisjonen, bokas viktigste enkeltmoment.)

En kandidat skriver: «Vi fikk p = 0,02. Det betyr at det er bare 2 % sjanse for at nullhypotesen er riktig, så vi kan være 98 % sikre på at behandlingen virker.»

a) Hvilken feil har kandidaten gjort? Nevn feilkoden.
b) Skriv en korrekt tolkning av p = 0,02.

Løkke 4 — Å tolke oppgitte p-verdier: α-skifte og halvering (~16 min)

— naturlig pausepunkt —

På eksamen får du som regel p oppgitt og skal konkludere. Regelen er enkel: forkast H0H_0 hvis pαp \leq \alpha, behold ellers. Men to grep skiller A- fra C-besvarelsene:

1. α-skiftet: en p som ligger mellom 0,01 og 0,05 (f.eks. 0,048 eller 0,017) snur konklusjon når du bytter fra α = 0,05 til det strengere α = 0,01. Slike «vippeverdier» er faste deloppgaveledd.
2. Halveringen: enhalet p er halvparten av tohalet. En tohalet p=0,072p = 0{,}072 (behold ved 0,05) blir enhalet p=0,036p = 0{,}036 (forkast ved 0,05) — men bare hvis retningen var begrunnet på forhånd.

Og husk: signifikans ≠ viktighet. At p<αp < \alpha sier «forskjellen er trolig ekte», ikke «forskjellen er stor eller viktig». Konvensjonsgrensen 0,05 er dessuten nettopp det — en konvensjon; 0,049 og 0,051 er praktisk talt like sterke resultater.

✏️Eksempel — å konkludere ved to α-nivåer og ved en-/tohalet

En studie tester om en app senker eksamensangst. Tohalet test gir oppgitt p=0,017p = 0{,}017.

a) Konkluder ved α=0,05\alpha = 0{,}05 og ved α=0,01\alpha = 0{,}01.
b) Anta i stedet at forskeren hadde en begrunnet retningshypotese (appen senker angst) og gjorde en enhalet test. Hva ville enhalet p bli, og hva endrer det?

a) Ved α=0,05\alpha = 0{,}05: 0,017<0,050{,}017 < 0{,}05forkast H0H_0 — resultatet er signifikant. Ved det strengere α=0,01\alpha = 0{,}01: 0,017>0,010{,}017 > 0{,}01behold H0H_0 — nå er det ikke signifikant. Dette er en typisk «vippeverdi»: samme data, ulik konklusjon avhengig av α-nivået vi setter på forhånd.

b) Enhalet p er halvparten: 0,017/2=0,00850{,}017 / 2 = 0{,}0085. Nå er 0,0085<0,010{,}0085 < 0{,}01, så resultatet ville vært signifikant også ved det strenge α = 0,01. Men dette gjelder kun fordi retningen var begrunnet før dataene ble sett — ellers er halveringen ikke tillatt (feil #11).

Tolkning i ord: p forteller hvor uvanlig resultatet er under H0H_0. Om vi kaller det «signifikant» avhenger av terskelen α og av om testen var én- eller tohalet — begge valg må gjøres før dataene ses.

📝Oppgave 4.1.5
(Eksamenssjanger T2 — tolk oppgitt p ved α-skifte, gjenganger.)

En tohalet test av et nytt søvnråd gir oppgitt p=0,048p = 0{,}048.

a) Konkluder ved α=0,05\alpha = 0{,}05.
b) Konkluder ved α=0,01\alpha = 0{,}01.
c) Betyr en signifikant p her at effekten er stor og viktig? Forklar.

📝Oppgave 4.1.6
(Eksamenssjanger T2 — full mønsterklon (krevende): hypoteser, trinn, α-skifte og enhalet-drøfting.)

En konsentrasjonstest har befolkningssnitt μ0=50\mu_0 = 50. Et nytt utvalg på n=64n = 64 personer som har fått en pausetrening, får xˉ=52\bar{x} = 52 med SD=8SD = 8. Tohalet test gir oppgitt p=0,046p = 0{,}046. Bruk SE=SDn\displaystyle SE = \frac{SD}{\sqrt{n}}.

a) Formuler H0H_0 og H1H_1 (tohalet), og regn SESE.
b) Gjør rede for de fem trinnene og konkluder ved α=0,05\alpha = 0{,}05.
c) Hva ville en enhalet test (begrunnet retning: pausetrening hever skår) endret? Regn enhalet p og konkluder ved både 0,05 og 0,01.
d) Hva må til for at den enhalede testen skal være faglig forsvarlig?

Begrepsbank — hypotesetesting

Flashcard-/repetisjonsstoff — hopp trygt over ved førstegangslesing; tidsanslaget over gjelder kjernestoffet.

H0 og H1 med μ
H0H_0: ingen effekt i populasjonen, μ=μ0\mu = \mu_0 (uskyldsantakelsen, det som testes). H1H_1 (Ha): det finnes en effekt, μμ0\mu \neq \mu_0 (ev. > / <). Begge gjelder populasjonsgjennomsnittet μ\mu, aldri utvalgssnittet.
Signifikansnivået α
α\alpha er terskelen p sammenlignes mot — konvensjonelt 0,05, av og til 0,01. Det er også risikoen for en Type I-feil (falsk alarm — dybde i kap. 4.2). α velges før dataene ses; grensen er en konvensjon, ikke en naturlov.
Beslutningsregelen

Forkast H0H_0 hvis pαp \leq \alpha; behold ellers. Å forkaste betyr «effekten er trolig ekte». Å beholde betyr ikke at H0H_0 er bevist — bare at bevisene ikke var sterke nok.

Utvalgsfordelingen som p bygger på

p leses fra utvalgsfordelingen — fordelingen av tenkte gjentatte utvalgsgjennomsnitt (jf. kap. 3.3). Dens spredning er standardfeilen SESE. Uten utvalgsfordelingen finnes ingen p — dette er en A-markør å nevne.

«Gitt at H0 er sann»-leddet

Kjernen i p-definisjonen: p er en betinget sannsynlighet — sannsynligheten for dataene forutsatt at H0H_0 holder. Uten dette leddet blir tolkningen feil #1.

Tohalet vs. enhalet
Tohalet: H1:μμ0H_1: \mu \neq \mu_0 (avvik begge veier — standard). Enhalet: H1:μ>μ0H_1: \mu > \mu_0 eller << (én retning, krever begrunnelse før data). Enhalet p = tohalet p / 2 — når effekten går i predikert retning.
Vippeverdier

En p mellom 0,01 og 0,05 (f.eks. 0,048, 0,017) gir signifikans ved α = 0,05 men ikke ved α = 0,01. Å snu konklusjonen ved α-skifte er et fast deloppgaveledd.

Signifikans ≠ viktighet
p<αp < \alpha sier at forskjellen trolig er ekte, ikke at den er stor eller praktisk viktig. Store utvalg gjør små, uviktige effekter signifikante (liten SESE). Rapporter alltid effektstørrelse i tillegg.
Indirekte bevisføring

Vi tester H0H_0, ikke H1H_1: antar «ingen effekt», ser om dataene blir usannsynlige under den antakelsen, og forkaster H0H_0 hvis de blir det. Vi «beviser» aldri H1H_1 direkte.

«Ikke signifikant» betyr ikke «ingen effekt»

Å beholde H0H_0 er fravær av bevis, ikke bevis på fravær. En ikke-signifikant test kan skyldes en ekte, men liten effekt, eller for lite utvalg (lav power — kap. 4.2).

μ vs. x̄ i hypoteser

Hypotesene handler om populasjonssnittet μ\mu (ukjent), ikke om utvalgssnittet xˉ\bar{x} (kjent). Å skrive H0:xˉ=50H_0: \bar{x} = 50 er feil #12 — vi tester det vi ikke vet, ikke det vi har målt.

Konvensjonens vilkårlighet

α = 0,05 er en konvensjon, ikke en naturlov. p = 0,049 og p = 0,051 er nesten identisk sterke resultater, selv om det ene «passerer» og det andre ikke. En A-kandidat nevner dette.

Testobservator

Et tall (t, F, z …) som oppsummerer hvor langt dataene ligger fra det H0H_0 forutsier, målt i standardfeil-enheter. Stor testobservator ⟹ liten p. Hvilken observator kommer an på testvalget (kap. 4.3).

Trinnene i en test

1) formuler H0H_0/H1H_1 om μ\mu; 2) velg α\alpha; 3) velg og utfør test; 4) finn p fra utvalgsfordelingen; 5) forkast hvis pαp \leq \alpha. På eksamen oppgis ofte p — tolkningen er jobben din.

p er ikke P(H0)

p er ikke sannsynligheten for at H0H_0 er sann, og ikke for at den er feil. Hypotesen er sann eller ikke; det er dataene som er tilfeldige. Å bytte om «data gitt hypotese» og «hypotese gitt data» er feil #1.

Enhalet krever forhåndsbegrunnelse

En enhalet test er kun tillatt når retningen er begrunnet i teori/tidligere funn før dataene ses. Velges den i etterkant for å presse p under grensen, er det feil #11.

Falsifiserbarhet i H0-logikken

Nullhypotesetesting er et falsifiseringsapparat: vi kan forkaste (falsifisere) H0H_0, men aldri «bevise» den. Derfor beholder vi H0H_0 heller enn å akseptere den.

Effektstørrelse

Et mål på hvor stor en effekt er (f.eks. selve differansen, eller standardiserte mål), uavhengig av utvalgsstørrelse. Supplerer p: p sier «ekte?», effektstørrelsen sier «hvor mye?».

Alfa som Type I-risiko

Ved å sette α = 0,05 aksepterer vi 5 % risiko for å forkaste en sann H0H_0 (falsk alarm). Et strengere α (0,01) reduserer denne risikoen, men gjør det vanskeligere å oppdage ekte effekter (bro til kap. 4.2).

Repetisjon — pensumkart for 4.1
Symbol- og formelliste

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.

Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Universitetet i Oslo. Dette er ikke offisielt studiemateriell. Innholdet er læringsstoff, ikke helse- eller medisinske råd. Les mer.