Tilbake
4.3

4.3 Testvalg — t-test, ANOVA og ANCOVA

«Hvilken test, og hvorfor?» — differensieringsformelen gjennom ti år, fra to grupper til fem, og kovariat-grepet sensor kaller en oppgave «ment å skille gode kandidater».

55 min
4 oppgaver
Testvalgt-testANOVAANCOVA
Din fremgang i kapitlet
0 / 4 oppgaver
Forkunnskaper. Dette kapitlet bygger på kap. 4.1 (hypoteser, α, to-/enhalet) og kap. 2.3 (faktorielle design, hovedeffekt og interaksjon — grunnlaget for toveis ANOVA). Fra tallsiden hjelper kap. 3.4 (t-testen for to grupper).

Sist du var her (nøkkelbegrepene oppfrisket):

- t-testen sammenligner to gruppegjennomsnitt (fra 3.4).
- Signifikansnivået α\alpha er risikoen for en falsk positiv ved én test (fra 4.1) — dette blir nøkkelen til hvorfor mange t-tester er farlig.
- Faktor, nivå og interaksjon i faktorielle design (fra 2.3) — grunnlaget for når vi trenger toveis ANOVA.

Her lærer du å velge riktig test og — viktigst — å begrunne valget.

Løkke 1 — Fra to grupper til mange: t-test og ANOVA (~20 min)

Hverdagsanker. Tenk deg at du vil vite om fire kaffemerker smaker ulikt. Du kunne sammenlignet dem to og to — merke 1 mot 2, 1 mot 3, 1 mot 4, 2 mot 3, og så videre. Men jo flere slike parvise smakstester du gjør, desto større sjanse er det for at minst én av dem gir et tilfeldig «treff» — akkurat som at du oftere trekker en dublett jo flere lodd du kjøper.

Det er nøyaktig dette problemet som gjør at vi ikke kjører mange t-tester når vi har flere enn to grupper. Vi trenger én samlet test i stedet. Vi bygger begrunnelsen ledd for ledd.

Uparet t-test (to uavhengige grupper)

Når du sammenligner gjennomsnittet i to uavhengige grupper, bruker du en uparet t-test. Den regner ut om differansen mellom de to gjennomsnittene er stor relativt til den tilfeldige variasjonen (jf. kap. 3.4).

Testen er tohalet med mindre du har en begrunnet retningshypotese (jf. kap. 4.1). t-testen er riktig valg bare ved nøyaktig to grupper — ved tre eller flere trenger vi noe annet.

Familywise error (samlet feilrate)
Familywise error er den samlede sannsynligheten for å begå minst én Type I-feil (falsk alarm) når du gjør flere tester på samme datasett.

Hver enkelt t-test har feilrisiko α=0,05\alpha = 0{,}05. Men gjør du mange, hoper risikoen seg opp: med 10 uavhengige tester er sjansen for minst én falsk positiv omtrent 10,95100,401 - 0{,}95^{10} \approx 0{,}40 — altså 40 %, ikke 5 %. Dette er kjernebegrunnelsen for hvorfor mange parvise t-tester er en dårlig idé ved flere grupper.

Hvorfor antallet parvise sammenligninger eksploderer. Med kk grupper er antallet par (k2)=k(k1)2\binom{k}{2} = \dfrac{k(k-1)}{2} (en liten talleillustrasjon — ikke noe du regner på eksamen):

- 3 grupper → 3 par
- 4 grupper → 6 par
- 5 grupper → 10 par

Med fem grupper (et typisk eksamenstall) blir det ti t-tester. Ti tester à 5 % risiko er ikke 5 % samlet risiko — den samlede (familywise) risikoen for minst én falsk alarm er da rundt 40 %. Løsningen er én samlet test.

Enveis mellomgruppe-ANOVA (tre eller flere grupper)
ANOVA (ANalysis Of VAriance — variansanalyse) er én samlet test som sammenligner gjennomsnittene i tre eller flere grupper samtidig. En enveis mellomgruppe-ANOVA brukes når du har én uavhengig variabel med tre eller flere nivåer og uavhengige grupper.

Kjernebegrunnelsen (det sensor krever): ANOVA holder den samlede feilraten (familywise error) på α\alpha i stedet for å la den eksplodere over mange parvise t-tester. Den svarer på ett spørsmål: «er det noen forskjell et sted mellom gruppene?» — uten å blåse opp Type I-risikoen. Ingen ANOVA-regning kreves på eksamen; begrunnelsen ER poenget.

📝Oppgave 4.3.1
(Eksamenssjanger T6 — testvalgsoppgaven. Lett innstegsoppgave: to eller flere grupper?)

En forsker sammenligner reaksjonstid i to grupper (koffein vs. placebo).

a) Hvilken test passer?
b) En annen forsker sammenligner fem grupper (fem koffeindoser). Hvilken test bør hun bruke i stedet for fem–ti t-tester?

📝Oppgave 4.3.2
(Eksamenssjanger T6 — begrunnelsen ER poenget (feil #7).)

En student skriver: «Med fem grupper kjørte jeg ti t-tester og fant to signifikante forskjeller.»

a) Hvilken feil har studenten begått? Nevn feilkoden.
b) Forklar hvorfor dette er et problem, med et tall.
c) Hva burde studenten gjort?

Løkke 2 — ANCOVA: kovariaten som skiller kandidatene (~18 min)

— naturlig pausepunkt —

Kovariat

En kovariat er en tilleggsvariabel som henger sammen med både den uavhengige variabelen (UV) og den avhengige (AV), og som du vil kontrollere for — regne bort effekten av — så den ikke forurenser sammenligningen mellom gruppene.

Eksempel: sammenligner du fem studieteknikker (UV) på eksamensskår (AV), kan søvnmengde være en kovariat hvis den både varierer mellom gruppene og påvirker skåren. Uten å ta hensyn til søvn vet du ikke om forskjellen skyldes teknikken eller søvnen.

ANCOVA (variansanalyse med kovariat)
ANCOVA (ANalysis of COVAriance — kovariansanalyse) er en ANOVA som i tillegg kontrollerer bort en eller flere kovariater. Den «renser» AV for kovariatens innflytelse før gruppene sammenlignes — som å justere alle deltakere til samme nivå på kovariaten.

Vilkårene: kovariaten må (i) korrelere med AV og (ii) helst være målt før manipulasjonen. ANCOVA øker presisjonen (reduserer uforklart støy) og fjerner en systematisk skjevhet mellom gruppene. Sensor kaller ANCOVA-leddet et oppgaveelement «ment å skille gode kandidater» — å nevne begrepet uoppfordret og forklare hva kovariaten gjør, er en klar A-markør.

ANCOVA vs. toveis ANOVA — samme tilleggsvariabel, ulikt grep. Har du en tilleggsvariabel (f.eks. kjønn), kan du behandle den på to måter:

- ANCOVA: kontroller den bort som kovariat — du er ikke interessert i den selv, bare i å fjerne dens forstyrrelse.
- Toveis ANOVA: modeller den som en ekstra faktor — du vil vite om den selv har en effekt, og om den samspiller (interagerer) med hovedfaktoren (jf. kap. 2.3). Er tilleggsvariabelen en egenskap som ikke kan manipuleres (kjønn, alder), er den en kvasi-UV.

Begge er akseptable med god begrunnelse — valget avhenger av om tilleggsvariabelen er en forstyrrelse du vil fjerne, eller et fenomen du vil studere.

✏️Eksempel — fem studieteknikker, med og uten kovariat

Fem studieteknikk-grupper (n = 20 hver) sammenlignes på eksamensskår. Forskerne oppdager at gruppene også skiller seg i gjennomsnittlig søvnmengde, og søvn påvirker skår.

a) Hvilken test er riktig for grunnsammenligningen, og hvorfor ikke mange t-tester?
b) Hva bør de gjøre for å ta hensyn til søvn, og hva heter det?

a) Med fem grupper er riktig valg én enveis mellomgruppe-ANOVA. Grunnen til å ikke kjøre ti parvise t-tester er familywise error: ti tester à 5 % gir rundt 40 % samlet risiko for minst én falsk alarm (10,95100,401 - 0{,}95^{10} \approx 0{,}40). ANOVA holder den samlede feilraten på α.

b) Siden søvn henger sammen med både gruppetilhørighet (UV) og skår (AV), er den en kovariat. Forskerne bør bruke en ANCOVA — en ANOVA som kontrollerer bort søvnmengden før gruppene sammenlignes. Da isolerer de effekten av selve studieteknikken fra søvnens innflytelse.

Tolkning i ord: ANCOVA «justerer» alle grupper til samme søvnnivå, slik at en eventuell gjenværende forskjell i skår kan tilskrives teknikken, ikke søvnen. (Alternativt kunne søvn modelleres som egen faktor i en toveis ANOVA — men her er søvn en forstyrrelse de vil fjerne, ikke studere, så ANCOVA passer best.)

📝Oppgave 4.3.3
(Eksamenssjanger T6 — ANCOVA-leddet, uttalt A/B-skille (krevende).)

Tre undervisningsmetoder sammenlignes på matteprøveskår. Elevenes sosioøkonomiske status (SES) varierer mellom klassene og påvirker skåren.

a) Hvilken grunntest passer for de tre gruppene, og hva er begrunnelsen?
b) Forskerne vil kontrollere for SES. Hva heter grepet, og hva er vilkårene for at det gir mening?
c) Kunne SES i stedet behandles som en egen faktor? Hva ville det kalles, og når er det å foretrekke?

Løkke 3 — Beslutningstreet og bedre kausal kontroll (~17 min)

— naturlig pausepunkt —

📜Beslutningstre for testvalg

Spør deg gjennom disse leddene:

1. Hvor mange grupper/betingelser?
- Nøyaktig to uavhengige grupper → uparet t-test (tohalet, ev. begrunnet enhalet).
- Tre eller flere grupper, én UV → enveis mellomgruppe-ANOVA (holder familywise error nede).
2. Er det en tilleggsvariabel jeg vil håndtere?
- Vil kontrollere den bort (forstyrrelse) → legg til som kovariatANCOVA.
- Vil studere den selv (og et mulig samspill) → legg til som ekstra faktortoveis ANOVA (er den ikke-manipulerbar, er den en kvasi-UV).

Alltid: begrunn valget i prosa. Testvalget uten begrunnelse er feil #7 — begrunnelsen er poenget.

Figuren under viser beslutningstreet som ja/nei-porter nedover: hvert «nei» grener til sitt testvalg.

Bedre kausal kontroll i korrelasjonsspørsmål (V2024s «tenk selv»-variant). Noen ganger spør oppgaven hvordan man kan komme nærmere en årsakskonklusjon når et ekte eksperiment ikke er mulig. Da er poenget å nevne flere veier:

- Longitudinelle design (måle over tid) — hjelper med retningsproblemet (hva kom først).
- Multippel regresjon med kontrollvariabler — statistisk kontroll for tredjevariabler (bro til kap. 5.3).
- Gruppesammenligninger / kvasieksperiment — sammenligne naturlige grupper.
- RCT (randomisert kontrollert forsøk) — gullstandarden, men med etisk forbehold når manipulasjon ikke er forsvarlig.

En A-besvarelse velger og begrunner ut fra caset, i stedet for å ramse alle (feil #8 — oppramsing uten begrunnelse).

📝Oppgave 4.3.4
(Eksamenssjanger T6 — beslutningstreet anvendt.)

For hvert scenario: hvilken test, og hva er begrunnelsen (én setning)?

a) To grupper (ny app vs. gammel app) sammenlignes på læringsutbytte.
b) Fire treningsprogrammer sammenlignes på kondisjon.
c) Fire treningsprogrammer sammenlignes på kondisjon, men forskerne vil kontrollere bort deltakernes utgangsform (målt før studien).

Begrepsbank — testvalg

Flashcard-/repetisjonsstoff — hopp trygt over ved førstegangslesing; tidsanslaget over gjelder kjernestoffet.

Beslutningsregel: gruppeantall
To uavhengige grupper → uparet t-test. Tre eller flere grupper, én UV → enveis mellomgruppe-ANOVA. Antallet grupper er første spørsmål i testvalget.
Hvorfor ikke mange t-tester

Hver t-test har 5 % Type I-risiko. Mange tester på samme data blåser opp den samlede (familywise) risikoen — ti tester gir rundt 40 %. ANOVA holder den samlede feilraten på α. Dette er kjernebegrunnelsen (feil #7).

Antall parvise sammenligninger

Med kk grupper er antallet par k(k1)2\displaystyle \frac{k(k-1)}{2}: 3→3, 4→6, 5→10. Antallet vokser raskt — derfor eksploderer den samlede feilraten. En liten illustrasjon, ikke et regnestykke for eksamen.

ANCOVA vs. toveis ANOVA

Samme tilleggsvariabel, ulikt grep. ANCOVA: kontroller den bort som kovariat (forstyrrelse). Toveis ANOVA: modeller den som egen faktor (fenomen med mulig interaksjon). Valget avhenger av om du vil fjerne eller studere variabelen.

Kovariatens vilkår

En kovariat må korrelere med AV og helst være målt før manipulasjonen. Da kan ANCOVA kontrollere den bort, redusere støy og fjerne en systematisk skjevhet mellom gruppene.

Kvasi-UV som faktor

Behandler du en ikke-manipulerbar egenskap (kjønn, alder) som en ekstra faktor i en toveis ANOVA, er den en kvasi-UV. Da studerer du dens effekt og samspill, i stedet for å kontrollere den bort (kobling til kap. 2.3).

Begrunnelsen er poenget

Sensor honorerer hvorfor mer enn hvilken. «Jeg brukte ANOVA» uten familywise-begrunnelsen gir lite; å velge test og forklare valget for det konkrete caset er A-kravet.

Ingen ANOVA-regning

Testvalgsoppgaven krever aldri at du regner ut en ANOVA eller ANCOVA. Den er en begrunnet drøfting av hvilken test som passer og hvorfor — ikke et regnestykke.

Bedre kausal kontroll uten RCT

Når et ekte eksperiment er umulig, kan man nærme seg årsak via longitudinelle design (retning), multippel regresjon med kontrollvariabler (tredjevariabler), gruppesammenligninger, eller RCT med etisk forbehold. Velg og begrunn (V2024).

Uparet t-test er tohalet som standard

t-testen for to grupper er tohalet med mindre en retningshypotese er begrunnet på forhånd (kobling til kap. 4.1). Å velge enhalet uten begrunnelse er feil #11.

Repetisjon — pensumkart for 4.3
Symbol- og formelliste

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.

Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Universitetet i Oslo. Dette er ikke offisielt studiemateriell. Innholdet er læringsstoff, ikke helse- eller medisinske råd. Les mer.